
一、引言:AI在医学中的进展与挑战并存
2025年,人工智能在医学领域取得了多方面的显著进展,但从强大的模型性能到实际的临床影响力之间,仍存在明显的转化鸿沟。本章全面梳理了AI在分子生物学、临床应用、患者参与和伦理考量等层面的最新动态。核心发现包括:在分子生物学领域,更小、更专业化的模型正在超越大规模通用模型;在临床推理任务上,领先AI模型的结构化评估得分已超过多数执业医师,但近半数临床研究仍依赖模拟场景而非真实患者数据;在实际应用中,能够无缝融入现有临床工作流的工具(如环境智能记录系统和脓毒症预测系统)正获得更广泛的采纳。此外,美国食品药品监督管理局(FDA)授权的AI医疗器械数量持续增加,但临床证据的积累速度相对滞后。同时,患者已能直接在搜索引擎中获取AI生成的健康信息,但其监管与审核力度远低于正式审批通道中的工具。总体而言,AI对医学的影响毋庸置疑,但要实现规模化应用,仍需在临床证据、治理框架和伦理规范方面持续努力。

二、分子生物学:从中心法则到智能设计
1、研究热度与数据资源
2024至2025年间,AI驱动的蛋白质研究出版物总量增长了约71%,总数从2,259篇跃升至3,855篇。其中,蛋白质-药物相互作用研究占比最大(2025年达54.4%),而蛋白质结构预测的相对份额有所下降,反映出该领域技术逐渐成熟,研究方向正向治疗应用倾斜。与此同时,生物医学视觉-语言模型和基因组基础模型所需的数据集规模也在快速扩展,但相较于通用AI领域,生物医学数据仍显稀缺,且数据瓶颈比模型规模瓶颈更为突出。
2、蛋白质语言模型与结构预测
2025年,蛋白质语言模型的发展趋势从“规模竞赛”转向“效率与专业化”。例如,仅有1.11亿参数的MSAPairformer在ProteinGym基准测试中超越了以往所有方法;专注于基因组学的GPN-Star(2亿参数)在多项变异效应预测任务中击败了400亿参数的庞大模型。在蛋白质结构预测与共折叠建模方面,多个开源模型(如Boltz系列、OpenFold3)已能覆盖蛋白质数据库中的所有结构类型,且性能接近AlphaFold 3。然而,进一步的性能提升有赖于新数据源或更深层次的信息挖掘,如利用AI预测的“蒸馏”数据集将训练样本从数十万扩展至数千万。
3、蛋白质设计与虚拟细胞模型
基于共折叠模型的进步,新一代生成式蛋白质设计工具(如RFDiffusion、BoltzGen)纷纷涌现。在Adaptyv Bio举办的Nipah病毒结合剂设计挑战赛中,专业组合方法Mosaic表现优于通用型方法,但所有设计均未能中和靶蛋白,凸显了从“结合”到“功能”的跨越仍具挑战。虚拟细胞模型成为2025年的新兴前沿,Arc Institute的Evo 2、DeepMind的AlphaGenome等模型旨在预测细胞对药物和基因扰动的反应,但当前仍需实验验证。总体来看,在多项基准测试中,专用小模型仍优于通用大模型,再次印证数据质量与训练策略的重要性。
4、多模态与自动化发现
多模态基础模型(如视觉-语言模型、视觉-组学模型)在生物医学发现中的应用呈爆发式增长。2025年,自动化科学发现系统(如Robin、STELLA、Biomni)开始将数字推理与物理实验验证相结合,并涌现出多智能体协作框架(如Agent Laboratory、Virtual Lab),后者在SARS-CoV-2纳米抗体设计中产生了92种新型候选物。然而,这些系统输出仍需实验确认,离完全自动化科研尚有距离。

三、临床应用:从模型到实践
1、医学影像:数据稀缺与模型多样性
医学影像AI的训练数据量(约140万张X光片)远小于通用视觉模型(17亿张图像),3D影像(CT/MRI)数据更为匮乏。尽管模型种类已从放射学扩展至病理学、皮肤科、眼科等6个学科,但缺乏跨模型的标准化基准,阻碍了性能比较。MICCAI 2025设立的相关挑战赛是弥补这一缺口的早期尝试。
2、前瞻性临床试验增长
2025年,验证医学影像AI模型的前瞻性试验数量达到536项,同比增长28.5%,表明该领域正从回顾性研究向能够支撑医院采纳决策的临床验证迈进。代表性试验包括AI辅助乳腺X光筛查(MASAI)和基于常规CT的心血管风险预警(NOTIFY系列)。
3、大语言模型临床推理性能突出,但现实转化存疑
OpenAI的o1-preview推理模型在多项临床推理测试中表现卓越:在《新英格兰医学杂志》的复杂病例中,其鉴别诊断覆盖率达78%,前1位准确率52%;在管理推理任务中得分86%,远高于医师群体的34%-42%。然而,这些成绩均来自脱离真实临床环境的认知测试,AI辅助是否能改善患者结局仍有待前瞻性试验证实。
4、AI智能体在多步骤临床任务中崭露头角
2025-2026年,自主或半自主AI智能体成为临床AI的重要发展方向。多智能体框架通过分工协作(如诊断专家、药剂师角色)在基准测试中诊断准确率较单智能体提升7%至60%以上。微软的AI诊断编排器(结合OpenAI o3)在《新英格兰医学杂志》疑难病例上准确率达85.5%,而21名经验医师仅为20%。然而,在更接近真实临床的MedAgentBench虚拟电子病历环境中,最佳模型的任务完成率仅69.7%,表明可靠的全自主临床智能体尚处早期阶段。

5、FDA授权激增,但临床证据薄弱
截至2025年9月,FDA已累计授权1,357个AI/ML医疗器械,其中2025年单年授权达258项,创历史新高。放射科占比76.6%,但非放射科设备已从2016年的7项增至2025年的60项,显示AI正向心血管、神经、麻醉等领域扩展。然而,绝大多数设备通过510(k)途径获批,无需新临床试验;仅有2.4%的设备临床研究基于随机对照试验数据。市场高度集中于GE、西门子等头部企业,但大量小公司持有1-2项设备,生态较为分散。
6、企业级部署成效显著
2025年,临床AI从试点走向大规模部署,最具影响力的三类应用包括:
●环境智能记录系统:如Abridge平台,被超过150个医疗系统采用。医生记录时间减少83%,职业倦怠显著下降,西北医学报告投资回报率达112%。
●脓毒症预测系统:约翰霍普金斯大学的TREWS系统和UCSD的COMPOSER模型,分别使脓毒症死亡率相对降低18.7%和17%,并大幅缩短抗生素使用时间。
●生成式AI嵌入工作流:如ChatEHR生成病历摘要,以及自动解释化验结果的工具,获得85%以上用户认可。
7、证据缺口与治理框架
斯坦福-哈佛ARISE网络发布的《2026年临床AI现状报告》指出,近半数临床AI研究使用模拟数据,仅5%使用真实临床数据。此外,NOHARM基准测试显示,通用大语言模型在每100个临床案例中会产生11.8-14.6条严重有害建议(多为漏诊),但这些结果不适用于专门设计的、有人类监督的临床工具。治理方面,斯坦福的FURM框架正被推广至更多机构。
8、数字孪生:前景广阔但定义尚不统一
2025年,医疗数字孪生相关出版物达372篇,专利申请达4,926项,增长迅猛。然而,仅12.1%的研究符合美国国家科学院“个性化、动态更新、预测能力”的完整定义。在糖尿病随机对照试验中,71%的患者在一年内达到健康血糖水平并安全减少用药;肿瘤学领域的多项试验也显示出生存获益。

四、患者参与:信息接触与态度分化
1、AI概述主导健康信息检索
2025年,84%-92%的健康相关Google搜索会触发AI生成的摘要,症状和常见健康问题的触发率高达92%。这些AI概述已成为患者获取健康信息的“第一印象”,但其准确性和可靠性缺乏系统审查。
2、患者态度:有条件接受,强调人际信任
2020至2025年,关于患者对AI看法的出版物数量增长了十倍。研究发现,患者普遍有条件地接受AI,特别支持其在辅助角色(而非自主决策)中的应用,并高度担忧失去人性化关怀。信任主要来源于临床医生的推荐,而非技术本身。透明度与AI使用告知是患者的普遍诉求。现有研究以美国、英国、德国为主,对儿童、青少年及中低收入国家的覆盖严重不足。

五、伦理考量:治理主导,全球视角不同
2025年,43.4%的医学AI出版物涉及伦理讨论,较2024年(37.1%)明显提升,绝对数量翻倍。然而,讨论内容高度集中于治理议题(1,228篇),远多于算法问责(896篇)和社会影响(874篇)。生物安全议题在学术文献中几乎被忽视,全年仅14篇涉及。相比之下,全球健康领域的研究者更关注公平、公正和可及性等社会议题(占51.8%),与主流领域的“治理主导”模式形成鲜明对比。地理分布上,欧洲、东亚和北美贡献了大多数全球健康相关AI伦理研究,而撒哈拉以南非洲、拉美和大洋洲产出极少。
六、结语
2025年是AI在医学领域“从模型到实践”的关键转折年。分子生物学的“小模型超越大模型”现象、临床工作流中AI工具的真实效益、以及多智能体系统的初步成功,都彰显了AI赋能医学的巨大潜力。然而,模型性能与临床结局之间的证据链仍不完整,FDA快速通道带来的“重批准、轻验证”问题值得警惕,伦理讨论的范围也需拓宽至生物安全、算法公平和全球健康正义。未来,要实现AI对医学的深远影响,必须加强前瞻性临床试验、完善治理体系、并保障患者与公众的知情权与信任基础。



All you need to do is just to make it through today. Don't think about tomorrow. Just focus on today. 只需安度今日,莫忧明日阴晴,心无旁骛,守此须臾。早上好!
