
2026年7月22日
Joseph Breda,学生研究员,以及 Jake Sunshine,高级研究员,Google Research
我们通过一项全国规模的研究,首次展示了AI在鉴别诊断(differential diagnosis)和症状检查方面的研究成果。
快速链接
Quick links
概述
Overview
大量临床诊断仅凭基于语言的问诊即可得出。这些诊断性问诊通常由临床医生通过医患互动,在面对面或远程就诊中完成。尽管这些互动是症状评估的黄金标准,但它们常常受到经济、地理和系统性障碍的限制,导致可及性不足。当前的语言模型(Language Models, LMs)在基于精选医学案例研究的评估中已展现出强大的鉴别诊断能力,凸显了其支持诊断过程的潜力。然而,现有的评估主要依赖于精心策划、细节详尽、有时甚至是合成的患者案例,这些案例可能无法反映真实世界的经验和临床表现的多样性。这些评估未能捕捉到普通患者如何报告其健康症状,例如医学素养水平不一、信息不完整,以及自然对话中出现的其他复杂情况。这构成了一个关键差距,导致我们无法确定语言模型在真实世界场景中可能的表现。
为填补这一空白,我们开展了一项原位比较研究,对象是一组实验性的对话式AI原型智能体,旨在探索对话式AI如何为研究基准测试目的进行端到端的症状问诊和鉴别诊断评估。在我们最新的研究论文《SymptomAI: Towards a Conversational AI Agent for Everyday Symptom Assessment》中,我们分享了一项随机全国规模研究(n=13,917)的结果。在该研究中,经过同意的研究参与者与五个可能的 Gemini Flash 2.0 SymptomAI 智能体之一进行互动。研究中生成的所有诊断、标签和疾病关联仅用于研究分析,不构成确诊的临床诊断或官方医学评估。在与AI智能体互动两周后,我们要求研究参与者报告他们从医疗保健提供者处获得的任何诊断。利用这些数据,我们进行了一项临床专家标注研究,将SymptomAI的诊断性能与真实临床医生的医学评估进行比较。
在评估了SymptomAI的鉴别诊断(DDx)准确性之后,我们进一步将SymptomAI的诊断结果与参与者在与SymptomAI对话前一段时间内Fitbit可穿戴设备的生物信号进行了比较。 我们表明,导致诊断为传染性病因的SymptomAI对话与可能指示免疫反应的生理趋势相关,这为SymptomAI的性能提供了进一步的证据。

在这项研究中,我们部署了一组用于端到端患者问诊和鉴别诊断评估的对话式AI智能体。参与者可以与智能体就其症状进行对话,接收一份候选鉴别诊断列表,并随后输入诊断结果。
工作原理
How it works
我们招募了13,917名经过同意的研究参与者,他们各自向五个随机分配的SymptomAI智能体之一描述自己的症状,这些智能体在进行症状问诊时的灵活程度各不相同。在这些对话中,参与者描述他们的症状,SymptomAI提出后续问题,对话最终得出一个最终的鉴别诊断(DDx,一份合理的诊断列表)和后续步骤建议。参与者随后可以去看医疗保健提供者,并在两周后通过调查问卷分享那次就诊的结果。为了评估SymptomAI的评估并建立基线,我们进行了一项临床专家标注研究,由三位委员会认证的临床医生组成的小组审查对话记录并提供他们自己的评估(即鉴别诊断)。然后,每位临床医生以盲法方式对SymptomAI提供的DDx以及其他临床医生提供的DDx进行排名。
关键结果
Key results
临床专家更偏好SymptomAI的DDx
Clinical experts preference for SymptomAI DDx
我们发现,在超过50%的案例中,临床医生更偏好SymptomAI生成的DDx,而非其他临床医生提供的DDx。这表明SymptomAI的DDx与我们的临床医生的医学评估的一致性,至少与其他临床医生一样频繁,甚至更频繁。

我们的临床评分者更倾向于将SymptomAI生成的DDx评为整体质量最佳的DDx。
临床专家发现SymptomAI的DDx更准确
Clinical experts found SymptomAI DDx to be more accurate
同样,我们通过前五准确率(Top-5 Accuracy,即参与者个人医疗保健提供者提供的真实诊断是否出现在DDx的五个可能诊断之一)来比较SymptomAI生成的DDx和真实临床医生提供的DDx的准确性。我们让每位临床医生判断所提供的诊断是否存在于每个DDx中,包括SymptomAI生成的DDx和临床医生提供的DDx。我们发现,临床医生认为SymptomAI生成的DDx准确的频率高于其他临床医生提供的DDx。

SymptomAI生成的DDx更有可能包含医疗保健提供者提供的自我报告诊断。
获取更多信息可提升性能
Eliciting more information improves performance
作为本研究的一部分,我们评估了进行病史采集问诊的不同方法。参与者被随机分配到五个研究组,每组采用不同的提示策略。两个组(动态实时和动态最终)被赋予完全自主权,可以提出不受限制的后续问题;另外两个组(固定规范和灵活规范)则从医学院教授的一套标准病史采集问题中提问;最后一个是基础无提示语言模型(Base unprompted LM),代表了当前查询LM聊天机器人时的完全用户驱动体验。我们发现,所有由智能体驱动的提示策略(即SymptomAI主动提出后续问题)都显著优于基础条件,证明了从参与者那里获取信息对于提高鉴别诊断准确性的价值。

按SymptomAI实验组划分的SymptomAI和临床医生的准确率。

按SymptomAI实验组划分的用户总词数。
SymptomAI在低置信度案例上的表现
SymptomAI performance on low-confidence examples
我们发现,在临床医生对自己的DDx最不自信的案例中,SymptomAI相对于临床基线的表现提升最为显著。

临床医生为SymptomAI和基线临床医生生成的DDx分配的前五准确率,按基线临床医生对其自身DDx的置信度分层。
SymptomAI的诊断与生物信号相关
Diagnosis from SymptomAI correlates with biosignals
鉴于SymptomAI相对于临床基线的准确性,我们还可以大规模探索其潜力。目前,临床标签的成本阻碍了对人群规模数据集的真实世界分析。像SymptomAI这样准确的症状检查系统有可能实现对临床质量诊断的自动参考标注,从而开启对生理数据的大规模分析——这是一项目前无法大规模完成的任务。其中一个例子是将可穿戴生物信号与不同疾病类别相关联。可穿戴生物信号最显著的变化是在急性呼吸道感染中观察到的。为了在人群规模上研究这一点,我们收集了同意参与者在与SymptomAI互动前最多30天的每日生物特征数据。我们发现,在用户报告症状前的几天里,存在明显的生物信号变化,表明症状发作。重要的是,队列之间的区分是通过对SymptomAI排名第一的候选诊断进行分类,并将被归类为呼吸道感染的诊断分组而得到的。该队列排除了非传染性呼吸道疾病,如过敏性鼻炎或慢性阻塞性肺疾病。可穿戴生物信号变化峰值与这些参与者报告症状的日期相吻合,这作为观察性生理证据,与他们报告的症状相一致。

在与SymptomAI对话前的几天里,相对于基线期(第-30天至-15天)的历史平均值,感染队列(红色)和基线队列(灰色)的可穿戴生物信号变化。感染队列包括SymptomAI诊断为呼吸道感染的参与者,而基线队列包括我们数据集中的所有其他参与者。第0天表示SymptomAI对话的日期。
与生物信号结合的实用性
Utility alongside biosignals
基于AI的症状表现评估为新的研究打开了大门。通过使用SymptomAI分析大量症状报告,并将其与实时的Fitbit数据配对,我们可以探索跨多种疾病的数字生物信号表型。我们的分析揭示了在用户与SymptomAI对话前的几天里,生理指标(包括心血管功能、呼吸、皮肤温度和睡眠质量)出现了明显的变化。这些客观变化与症状对话的时间点紧密吻合,为验证患者报告的症状提供了一种潜在方法,或者提供被动数据以帮助结合症状对话进行鉴别诊断。此外,这种实时可及性凸显了AI症状检查器的一个核心优势。与可能因日程安排延迟而受影响的传统临床预约不同,参与者可以在症状出现时立即参与SymptomAI研究。这可能会提高患者报告发病时间线的准确性——这是人群规模健康分析的一个关键细节。
局限性
Limitations
SymptomAI是一项探索性研究工作,可能代表了基于AI的症状评估领域的一项重大研究进展,并展示了其为寻求了解自身症状的普通公众提供帮助的潜力。虽然人群部署评估揭示了通过远程患者问诊进行症状评估的准确性,但与临床医生的评估相比,仍存在一些细微的局限性。
首先,鉴别诊断本身就是一个模糊的任务,即使报告出来的诊断也可能随时间纵向发展和变化。症状评估是时间上的一个快照,捕捉的是当时呈现的症状。由于我们部署的规模,我们无法控制症状报告的频率和时间。因此,一些参与者可能在更具代表性的指标出现之前就报告了症状,而另一些参与者则可能在多年慢性病经验后,从知情背景中报告了明显的指标。未来的工作可能会关注症状发展特定阶段的特定疾病,例如早期发作的代谢综合征或呼吸道感染初期讨论的症状。研究中生成的所有诊断、标签和疾病关联均为AI衍生,仅用于研究分析,不构成确诊的临床诊断或官方医学评估。
其次,在我们的评估中,临床医生审查的是静态的聊天记录,没有被赋予提出自己后续问题的自主权。如果由临床医生主导症状问诊,他们可能会凭直觉获取不同的信息。此外,尽管最近的研究表明,对话式AI系统能够以临床医生级别的细节和准确性获取临床数据,但此类系统可能会错过其他信号,如肢体语言、视觉评估、病历,或者在初级保健的背景下,与患者已有的融洽关系。
总之,我们介绍了SymptomAI,一个用于进行真实世界患者问诊和症状评估的研究性对话式AI智能体。我们通过人群样本上的DDx准确性展示了SymptomAI的端到端真实世界性能,并展示了SymptomAI的诊断如何能够实现对人群规模信号(如可穿戴生物信号)的分析,以识别生理信号与报告疾病之间的关联。
致谢
Acknowledgements
这项工作由Joe Breda、Jake Sunshine和Daniel McDuff共同贡献。我们要感谢来自Google Research和Google DeepMind的合著者和合作者对本工作的贡献。
- 标签:
- 通用科学
- 健康与生物科学
- 自然语言处理
- 负责任AI
快速链接
Quick links
其他相关文章
Other posts of interest

2026年6月26日
在Pixel上利用冻结的多Token预测加速Gemini Nano模型

2026年6月24日
思考以回忆:推理如何解锁LLM中的参数化知识

2026年6月12日
研究AI如何帮助用户了解皮肤状况