报告解读来源 · Google Research2026-07-23 · 7 分钟读完

超半数临床专家偏爱AI诊断,SymptomAI首胜真人对照

全国万人研究中AI的鉴别诊断被53.3%的临床评审评为最佳,且在医生最不自信的案例中优势最大,实时可穿戴数据额外提供了生理佐证。

厂商内容本文内容来自Google Research官方博客,由其团队发表的研究成果,结论可能带有立场倾向,请审慎参考。
一分钟速览结论先行 · 门道在下面
  1. 规模:13,917人:全国随机研究共13,917名参与者与AI对话,为迄今最大规模的真实世界症状评估对比。
  2. 偏好:53.3%:在临床专家盲法评审中,SymptomAI生成的鉴别诊断被评选为“最佳”的比例达53.3%。
  3. 超越:超过50%:超过半数案例中,临床专家更偏好AI的鉴别诊断列表,而不是其他临床医生给出的列表。
  4. 5种提问策略:所有由AI主动提问的策略均显著优于完全用户驱动的模式,主动追问是性能提升的关键。
  5. 最多30天可穿戴:结合参与者最多30天的Fitbit生物信号发现,AI诊断与生理指标变化趋势相互吻合。
1

万人实测,AI鉴别诊断首胜真人

13,917名参与者随机对照的震撼结果

谷歌部署了5种基于Gemini Flash 2.0的对话式AI智能体SymptomAI,让13,917名研究参与者在真实就医前与其进行症状对话,并在2周后报告医生的诊断。一项由3位委员会认证临床医师组成的盲法小组,将AI生成的鉴别诊断与临床医生给出的诊断列表并列评审。

53.3%临床专家评AI诊断最佳比例
超过50%专家更偏好AI诊断列表的案例
◎ 我们的判断在未经脚本设计的真实症状问诊场景中,对话式AI已能稳定输出质量至少等同于人类医生的鉴别诊断列表,并在同行评审偏好上略胜一筹。这是首次通过全国性随机研究观察到此类趋势,而不仅仅是实验室基准。
2

医生越不自信,AI的优势越明显

低置信度案例中表现提升最为突出

研究按临床医师对自己诊断列表的置信度将案例分层,发现在医生自评最不自信的那些案例里,SymptomAI的前五准确率相对临床基线的领先幅度最大。即当人类临床医师直觉上没把握时,AI的参考价值反而更突出。

打个比方好比两位同行会诊,对自己初判不太确定的医师,更可以从第三方的系统化推理中受益,从而弥补个人经验盲区。
◎ 我们的判断AI与人类医师的差距感不是均匀的,而是集中在自己难以拿捏的灰色地带。这说明SymptomAI最有价值的应用场景可能是为低确定性问诊提供辅助决策,而非取代整个诊断流程。
3

追问是分水岭,交互策略很关键

五组实验对比揭示主动问诊的价值

参与者被随机分配到五种提示策略:两种赋予AI完全自主提问权,两种从医学院标准病史问题中提问,一种是基础语言模型完全由用户自由输入。结果显示,所有智能体驱动提问的策略均显著优于基础模式,证实主动获取信息能系统性地提高鉴别诊断准确率。

术语卡 · 基础无提示语言模型指类似当前通用聊天机器人的使用方式,用户自行描述症状,AI不主动追问,完全由用户主导对话流程。
4

可穿戴信号为AI诊断提供物理背书

呼吸道感染队列的生理数据与诊断吻合

研究收集了参与者在与SymptomAI互动前最多30天的Fitbit日常生物特征数据。SymptomAI将诊断为呼吸道感染的参与者作为感染队列,其余为基线队列。分析发现,感染队列在症状报告前的几天里,心血管、呼吸、皮温和睡眠等生理指标出现与免疫反应趋势一致的明显变化,且峰值时间恰好与对话日期吻合。

感染队列生理偏离症状前出现明显生物信号变化
基线队列稳定未出现相似模式的生理波动
打个比方就好像汽车仪表盘的温度和转速读数,能佐证驾驶员报告的“发动机有点异常”,AI的诊断与可穿戴数据相互印证,为患者主观描述增添了客观锚点。
5

快照式评估的边界

静态聊天无法替代完整的临床情境

研究评委审查的是静态聊天记录,缺乏亲自追问的权利,也无法调用肢体语言、病历或医患关系等临床信号。此外,症状评估只是时间上的一个快照,病情可能随后纵向演变,部分参与者可能过早报告了非典型表现,或受了多年慢性病史的影响而描述了不同的重点。

来源与口径

本文为 CyberFocus 对原报告的编译解读,所有数字逐字出自原文,未作外推。 样本为全国性随机招募的13,917名参与者;数字均出自Google Research报告原文,包括图片标示的53.3%。

阅读原文 →
解读与翻译仅供学习交流使用,内容版权归原作者所有。

SymptomAI:面向日常症状评估的对话式AI代理

SymptomAI: Towards a conversational AI agent for everyday symptom assessment

📅2026-07-23👤Google ResearchGoogle Research
✍️翻译:DeepSeek
#实验室研究

2026年7月22日

Joseph Breda,学生研究员,以及 Jake Sunshine,高级研究员,Google Research

我们通过一项全国规模的研究,首次展示了AI在鉴别诊断(differential diagnosis)和症状检查方面的研究成果。

快速链接

Quick links

  • 论文
  • 代码

概述

Overview

大量临床诊断仅凭基于语言的问诊即可得出。这些诊断性问诊通常由临床医生通过医患互动,在面对面或远程就诊中完成。尽管这些互动是症状评估的黄金标准,但它们常常受到经济、地理和系统性障碍的限制,导致可及性不足。当前的语言模型(Language Models, LMs)在基于精选医学案例研究的评估中已展现出强大的鉴别诊断能力,凸显了其支持诊断过程的潜力。然而,现有的评估主要依赖于精心策划、细节详尽、有时甚至是合成的患者案例,这些案例可能无法反映真实世界的经验和临床表现的多样性。这些评估未能捕捉到普通患者如何报告其健康症状,例如医学素养水平不一、信息不完整,以及自然对话中出现的其他复杂情况。这构成了一个关键差距,导致我们无法确定语言模型在真实世界场景中可能的表现。

为填补这一空白,我们开展了一项原位比较研究,对象是一组实验性的对话式AI原型智能体,旨在探索对话式AI如何为研究基准测试目的进行端到端的症状问诊和鉴别诊断评估。在我们最新的研究论文《SymptomAI: Towards a Conversational AI Agent for Everyday Symptom Assessment》中,我们分享了一项随机全国规模研究(n=13,917)的结果。在该研究中,经过同意的研究参与者与五个可能的 Gemini Flash 2.0 SymptomAI 智能体之一进行互动。研究中生成的所有诊断、标签和疾病关联仅用于研究分析,不构成确诊的临床诊断或官方医学评估。在与AI智能体互动两周后,我们要求研究参与者报告他们从医疗保健提供者处获得的任何诊断。利用这些数据,我们进行了一项临床专家标注研究,将SymptomAI的诊断性能与真实临床医生的医学评估进行比较。

在评估了SymptomAI的鉴别诊断(DDx)准确性之后,我们进一步将SymptomAI的诊断结果与参与者在与SymptomAI对话前一段时间内Fitbit可穿戴设备的生物信号进行了比较。 我们表明,导致诊断为传染性病因的SymptomAI对话与可能指示免疫反应的生理趋势相关,这为SymptomAI的性能提供了进一步的证据。

四张智能手机截图展示了一个对话式症状检查器研究应用,该应用收集颈部疼痛症状,显示诊断摘要,并提示进行反馈评分。

在这项研究中,我们部署了一组用于端到端患者问诊和鉴别诊断评估的对话式AI智能体。参与者可以与智能体就其症状进行对话,接收一份候选鉴别诊断列表,并随后输入诊断结果。

工作原理

How it works

我们招募了13,917名经过同意的研究参与者,他们各自向五个随机分配的SymptomAI智能体之一描述自己的症状,这些智能体在进行症状问诊时的灵活程度各不相同。在这些对话中,参与者描述他们的症状,SymptomAI提出后续问题,对话最终得出一个最终的鉴别诊断(DDx,一份合理的诊断列表)和后续步骤建议。参与者随后可以去看医疗保健提供者,并在两周后通过调查问卷分享那次就诊的结果。为了评估SymptomAI的评估并建立基线,我们进行了一项临床专家标注研究,由三位委员会认证的临床医生组成的小组审查对话记录并提供他们自己的评估(即鉴别诊断)。然后,每位临床医生以盲法方式对SymptomAI提供的DDx以及其他临床医生提供的DDx进行排名。

关键结果

Key results

临床专家更偏好SymptomAI的DDx

Clinical experts preference for SymptomAI DDx

我们发现,在超过50%的案例中,临床医生更偏好SymptomAI生成的DDx,而非其他临床医生提供的DDx。这表明SymptomAI的DDx与我们的临床医生的医学评估的一致性,至少与其他临床医生一样频繁,甚至更频繁。

一张水平条形图比较了临床医生和SymptomAI的排名分布,显示SymptomAI在“最佳”位置(53.3%)被显著更多地偏好。

我们的临床评分者更倾向于将SymptomAI生成的DDx评为整体质量最佳的DDx。

临床专家发现SymptomAI的DDx更准确

Clinical experts found SymptomAI DDx to be more accurate

同样,我们通过前五准确率(Top-5 Accuracy,即参与者个人医疗保健提供者提供的真实诊断是否出现在DDx的五个可能诊断之一)来比较SymptomAI生成的DDx和真实临床医生提供的DDx的准确性。我们让每位临床医生判断所提供的诊断是否存在于每个DDx中,包括SymptomAI生成的DDx和临床医生提供的DDx。我们发现,临床医生认为SymptomAI生成的DDx准确的频率高于其他临床医生提供的DDx。

一张标题为“总体前五准确率”的水平条形图显示SymptomAI的准确率更高。

SymptomAI生成的DDx更有可能包含医疗保健提供者提供的自我报告诊断。

获取更多信息可提升性能

Eliciting more information improves performance

作为本研究的一部分,我们评估了进行病史采集问诊的不同方法。参与者被随机分配到五个研究组,每组采用不同的提示策略。两个组(动态实时和动态最终)被赋予完全自主权,可以提出不受限制的后续问题;另外两个组(固定规范和灵活规范)则从医学院教授的一套标准病史采集问题中提问;最后一个是基础无提示语言模型(Base unprompted LM),代表了当前查询LM聊天机器人时的完全用户驱动体验。我们发现,所有由智能体驱动的提示策略(即SymptomAI主动提出后续问题)都显著优于基础条件,证明了从参与者那里获取信息对于提高鉴别诊断准确性的价值。

一张分组条形图展示了五种提示策略下的前五准确率:基础、固定规范、灵活规范、动态实时和动态最终。SymptomAI在所有策略中均持续获得更高的准确率。

按SymptomAI实验组划分的SymptomAI和临床医生的准确率。

一张标题为“按提示策略划分的用户参与度”的抖动图比较了五种不同提示策略下的用户总词数分布。

按SymptomAI实验组划分的用户总词数。

SymptomAI在低置信度案例上的表现

SymptomAI performance on low-confidence examples

我们发现,在临床医生对自己的DDx最不自信的案例中,SymptomAI相对于临床基线的表现提升最为显著。

一张条形图显示,在临床医生自我报告的不同置信度水平下,SymptomAI均保持更高的前五准确率。

临床医生为SymptomAI和基线临床医生生成的DDx分配的前五准确率,按基线临床医生对其自身DDx的置信度分层。

SymptomAI的诊断与生物信号相关

Diagnosis from SymptomAI correlates with biosignals

鉴于SymptomAI相对于临床基线的准确性,我们还可以大规模探索其潜力。目前,临床标签的成本阻碍了对人群规模数据集的真实世界分析。像SymptomAI这样准确的症状检查系统有可能实现对临床质量诊断的自动参考标注,从而开启对生理数据的大规模分析——这是一项目前无法大规模完成的任务。其中一个例子是将可穿戴生物信号与不同疾病类别相关联。可穿戴生物信号最显著的变化是在急性呼吸道感染中观察到的。为了在人群规模上研究这一点,我们收集了同意参与者在与SymptomAI互动前最多30天的每日生物特征数据。我们发现,在用户报告症状前的几天里,存在明显的生物信号变化,表明症状发作。重要的是,队列之间的区分是通过对SymptomAI排名第一的候选诊断进行分类,并将被归类为呼吸道感染的诊断分组而得到的。该队列排除了非传染性呼吸道疾病,如过敏性鼻炎或慢性阻塞性肺疾病。可穿戴生物信号变化峰值与这些参与者报告症状的日期相吻合,这作为观察性生理证据,与他们报告的症状相一致。

一个由九张折线图组成的网格比较了基线期与感染期随时间变化的生物特征变化。

在与SymptomAI对话前的几天里,相对于基线期(第-30天至-15天)的历史平均值,感染队列(红色)和基线队列(灰色)的可穿戴生物信号变化。感染队列包括SymptomAI诊断为呼吸道感染的参与者,而基线队列包括我们数据集中的所有其他参与者。第0天表示SymptomAI对话的日期。

与生物信号结合的实用性

Utility alongside biosignals

基于AI的症状表现评估为新的研究打开了大门。通过使用SymptomAI分析大量症状报告,并将其与实时的Fitbit数据配对,我们可以探索跨多种疾病的数字生物信号表型。我们的分析揭示了在用户与SymptomAI对话前的几天里,生理指标(包括心血管功能、呼吸、皮肤温度和睡眠质量)出现了明显的变化。这些客观变化与症状对话的时间点紧密吻合,为验证患者报告的症状提供了一种潜在方法,或者提供被动数据以帮助结合症状对话进行鉴别诊断。此外,这种实时可及性凸显了AI症状检查器的一个核心优势。与可能因日程安排延迟而受影响的传统临床预约不同,参与者可以在症状出现时立即参与SymptomAI研究。这可能会提高患者报告发病时间线的准确性——这是人群规模健康分析的一个关键细节。

局限性

Limitations

SymptomAI是一项探索性研究工作,可能代表了基于AI的症状评估领域的一项重大研究进展,并展示了其为寻求了解自身症状的普通公众提供帮助的潜力。虽然人群部署评估揭示了通过远程患者问诊进行症状评估的准确性,但与临床医生的评估相比,仍存在一些细微的局限性。

首先,鉴别诊断本身就是一个模糊的任务,即使报告出来的诊断也可能随时间纵向发展和变化。症状评估是时间上的一个快照,捕捉的是当时呈现的症状。由于我们部署的规模,我们无法控制症状报告的频率和时间。因此,一些参与者可能在更具代表性的指标出现之前就报告了症状,而另一些参与者则可能在多年慢性病经验后,从知情背景中报告了明显的指标。未来的工作可能会关注症状发展特定阶段的特定疾病,例如早期发作的代谢综合征或呼吸道感染初期讨论的症状。研究中生成的所有诊断、标签和疾病关联均为AI衍生,仅用于研究分析,不构成确诊的临床诊断或官方医学评估。

其次,在我们的评估中,临床医生审查的是静态的聊天记录,没有被赋予提出自己后续问题的自主权。如果由临床医生主导症状问诊,他们可能会凭直觉获取不同的信息。此外,尽管最近的研究表明,对话式AI系统能够以临床医生级别的细节和准确性获取临床数据,但此类系统可能会错过其他信号,如肢体语言、视觉评估、病历,或者在初级保健的背景下,与患者已有的融洽关系。

总之,我们介绍了SymptomAI,一个用于进行真实世界患者问诊和症状评估的研究性对话式AI智能体。我们通过人群样本上的DDx准确性展示了SymptomAI的端到端真实世界性能,并展示了SymptomAI的诊断如何能够实现对人群规模信号(如可穿戴生物信号)的分析,以识别生理信号与报告疾病之间的关联。

致谢

Acknowledgements

这项工作由Joe Breda、Jake Sunshine和Daniel McDuff共同贡献。我们要感谢来自Google Research和Google DeepMind的合著者和合作者对本工作的贡献。

  • 标签:
    • 通用科学
    • 健康与生物科学
    • 自然语言处理
    • 负责任AI

快速链接

Quick links

  • 论文
  • 代码

其他相关文章

Other posts of interest

2026年6月26日

在Pixel上利用冻结的多Token预测加速Gemini Nano模型

  • 机器智能 · 移动系统 · 自然语言处理

2026年6月24日

思考以回忆:推理如何解锁LLM中的参数化知识

  • 生成式AI · 机器智能 · 自然语言处理

2026年6月12日

研究AI如何帮助用户了解皮肤状况

  • 健康与生物科学 · 人机交互与可视化