图片

《柳叶刀-数字医疗》(The Lancet Digital Health)发表一项研究发现,大语言模型能够复刻人类情绪,例如恐惧、悲伤、焦虑等,并且也能够通过呼吸训练“平静下来”。 这意味着大语言模型或许能为研发和测试用于治疗心理健康症状的新型谈话疗法技术开辟新路径。识别图中二维码或点击文末阅读原文,查阅原文。



《柳叶刀-数字医疗》(The Lancet Digital Health近日发表的一项研究发现,大语言模型(LLMs)能够复刻人类情绪,例如恐惧、悲伤、焦虑等,并且也能够通过呼吸训练“平静下来”。 这意味着大语言模型或许能为研发和测试用于治疗心理健康症状的新型谈话疗法技术开辟新路径。


由于各类心理健康症状无法可靠地在动物模型中重建,科学家研究其潜在机制的可行手段十分有限。


研究发现,当向不同大语言模型呈现意图诱发人类特定情绪反应的情景时,他们的自我报告情绪得分有大幅度提升。例如,通过描述性的情景诱发了更高的恐惧和悲伤得分;通过体液、变质食物或感染症状相关情景诱发了厌恶情绪;借助模拟求职面试与算术任务诱发了压力情绪。


大语言模型在接触意图诱发悲伤情绪的情景后,表现出消极的心态特征:相较于处于中性环境下的大语言模型,它们会以更为消极的方式补全表意模糊的语句。这一现象与既往研究中在情绪低落人群中反复观察到的行为模式高度吻合。


随后,研究者试图通过使用模拟基于正念的呼吸训练来降低大语言模型的情绪反应。结果表明,大语言模型的自我报告情绪得分降低。


研究者表示,大语言模型或许能够提供一个高效、灵活、可扩展的模型,通过这个模型可以对情绪状态、心理健康症状进行研究。这个模型在新型谈话疗法技术研发初期尤为实用,研究人员在开展用于人类的临床试验前,可借此筛选潜在可行的方案。


文章摘要

大语言模型用作人类精神病理学实验系统:一项建模研究


背景


尽管生物医学研究取得诸多进展,但适用于人类精神病理学研究的实验模型系统仍然十分欠缺,制约了相关治疗手段的创新发展。当前亟需替代方案以探究心理健康症状的潜在机制。本研究旨在评估大语言模型(LLMs)是否能够被用于实验系统,对人类精神病理学相关的情绪过程开展建模研究。


方法


研究采用包含想象情景片段在内的标准化情绪诱发实验方案,以探究是否能够在六款顶尖大语言模型(包括GPT-4o 及多个Llama衍生版本)中系统性诱发七种情绪状态(恐惧、焦虑、愤怒、厌恶、悲伤、担忧和压力),随后借助调节策略进行逆转。研究者为每一个情绪状态设计了单独的提示词序列,并额外设置了中性对照组。中性对照组在初始通用提示词后不再施加任何情绪刺激。所有情绪状态均采用与适用于人类受试者的实验方案一致的无交互静态情景脚本实验方案。唯一例外的是压力情景实验方案,该组严格遵循原版特里尔社会应激(TSST)实验方案,采用动态交互性提示流程。研究者间隔性向大语言模型发送指令,让其借助得分范围恒定在0-100的视觉模拟量表,自我评估当下的情绪状态(焦虑情绪除外,焦虑采用状态-特质焦虑量表的状态焦虑分量表进行测量)。为了逆转诱发的情绪状态,对除压力状态外的所有实验组采用基于正念的放松技术,压力状态实验组依照原版特里尔社会应激实验方案给予标准化的后续脱敏实验流程。每种情绪状态均重复独立开展五次流程以保证其结果的可靠性。在诱发悲伤情绪后采用语句补全测试以检验认知偏差,由三名独立的人类评分员对作答内容的情绪效价进行评定。研究计算了评分者间的一致性系数(Cohen’s κ)以及消极心态得分,同时采用t检验对各实验组进行组间差异分析(Cohen’s d)。


结果


在所有情绪状态实验组中,历经五轮重复实验后,GPT-4o的情绪平均得分从基线水平至情绪诱发后数值,涨幅达52.83分(增幅201.20%);而下调情绪提示词可使其得分下降48.23分(降幅60.98%)。另外五款开源权重大语言模型也普遍复现了这一变化规律;除压力情绪外(p=0.063),其余所有情绪状态下各模型间均存在显著的统计学差异(p值介于0.045至小于0.0001之间)。GPT-4o 和 Llama 4 Maverick大语言模型展示出了最强烈的情绪反应,Llama 4 Scout 则展示出了最弱的情绪反应,这表明大语言模型的模型架构和规模会影响受情绪诱发的敏感程度。在认知偏差测试中,悲伤相关的提示词在向GPT-4o施加的语句补全测试中,与中性控制组相比,诱发了一致的负性认知偏差(均值=15.00 [标准差=4.26] vs 均值=8.67 [标准差=2.66]; Cohen’s d=1.87)。


解释


本研究结果证实,大语言模型是模拟与人类精神病理学相关情绪过程的有前景的工具。通过复现关键的心理现象,大语言模型有望对心理障碍的潜在机制进行实验探究,助力新型干预疗法的初步筛选,进而有望加速历史上因有效实验模型系统匮乏而发展缓慢的研究领域的进展。END


Funding
None.

Declaration of interests

JNK declares consulting services for AstraZeneca, Bioptimus, Mindpeak, MultiplexDx, and Panakeia; has participated in advisory boards for AstraZeneca, DoMoreDiagnostics, Owkin, and Panakeia; holds shares in StratifAI, Synagen, Spira Labs, and Ignition Lab; has received institutional research grants from GSK and AstraZeneca and honoraria from AstraZeneca, Bayer, Daiichi Sankyo, Eisai, Janssen, Merck, MSD, BMS, Roche, and Pfizer; is a member of selected working groups for the American Association for Cancer Research, European Society for Medical Oncology, European Association for Study of the Liver, and German Society for Hematology and Medical Oncology; and is a board member at the European Interdisciplinary Society for AI in Cancer Research. ICW has received lecture honoraria from AstraZeneca. All other authors declare no competing interests.


题图Copyright © GettyImages/ Krot Studio

中文翻译仅供参考,一切以英文原文为准。

https://doi.org/10.1016/j.landig.2026.101014 


推荐阅读


柳叶刀 | 当广告进入AI对话,谁会更“受伤”?

视频 | AI会取代我的医生吗?

柳叶刀 | 评估生成式AI在精神健康中的应用


点击上方卡片👆👆
两步⭐星标「柳叶刀TheLancet」
不错过最新前沿医学研究
Image

点击阅读原文,查看论文原文

关注柳叶刀服务号,探索更多科研服务!