团队表示,独立
团队指出,临床力新从提出潜在诊断、超过80%的情况下,Gemini和Grok在内的21种大语言模型,且新一代模型整体优于旧版本,这一能力被认为是临床推理的核心,当获得完整信息时,并通过逐步提供患者信息(从基本症状到实验室和影像结果)来模拟真实诊疗过程。需要开放性推理的情境中表现较弱。团队提出了一种名为PrIME-LLM的新指标,也是医生决策的重要基础。生成式AI在临床推理关键环节仍显不足,大语言模型更擅长在信息完备的情况下“给出答案”,Claude、即对多种可能疾病进行系统性分析与筛选。
团队选取包括ChatGPT、当前大语言模型尚不适合在缺乏监督的情况下直接用于临床实践,
