中文

AI 能否共情:面向心理健康支持的大型语言模型回复测试

计算与语言 2024-10-10 v2

摘要

大型语言模型(LLM)已在 NYU Langone、Dana-Farber 和 NHS 等医院系统中投入试点临床使用。一个拟议的部署用例是心理治疗,即由 LLM 驱动的聊天机器人可以治疗经历心理健康危机的患者。部署 LLM 用于心理健康回复在假设上可以拓宽心理治疗的途径,并为个性化护理提供新的可能。然而,最近备受瞩目的失败案例,如 Tessa 聊天机器人向饮食失调患者提供有害的饮食建议,引发了人们对其在高风险和安全关键环境中可靠性的怀疑。在本研究中,我们开发了一个评估框架,以确定 LLM 回复是否是心理健康治疗自动化的可行且合乎伦理的路径。我们的框架衡量了共情方面的公平性以及 LLM 回复对动机访谈理论的依从性。使用受过训练的临床医生的人工评估和基于心理学研究的自动护理质量指标,我们比较了同伴回复者与 SOTA LLM 提供的回复。我们表明,像 GPT-4 这样的 LLM 会使用隐式和显式线索来推断患者的种族等人口统计学特征。我们随后表明,患者子群之间存在统计学上的显著差异:对黑人发帖者的回复始终比任何其他人口群体的共情水平更低(比对照组低 2%-13%)。令人鼓舞的是,我们确实发现生成回复的方式会显著影响回复的质量。最后,我们提出了将 LLM 部署用于心理健康回复的安全指南。

关键词

引用

@article{arxiv.2405.12021,
  title  = {Can AI Relate: Testing Large Language Model Response for Mental Health Support},
  author = {Saadia Gabriel and Isha Puri and Xuhai Xu and Matteo Malgaroli and Marzyeh Ghassemi},
  journal= {arXiv preprint arXiv:2405.12021},
  year   = {2024}
}

备注

EMNLP 2024 Findings