中文

MedVoiceBias:临床决策中音频 LLM 行为的受控研究

计算与语言 2025-11-11 v1 音频与语音处理

摘要

随着大型语言模型从文本界面向临床场景中的音频交互迁移,它们可能通过音频中的语音特征引入新的漏洞。我们对这些模型在170个临床案例中进行评估,每个案例均合成为36种不同声音档案的语音,声音档案涵盖年龄、性别和情绪的变化。我们的发现显示出严重的模态偏见:针对相同文本输入,音频输入所得的手术建议相差最高可达35%,其中一个模型提供的建议数量减少了80%。进一步分析发现,年龄差异可达12%,这种差异在大多数模型中即使在链式思考提示下仍然存在。虽然显式推理成功消除了性别偏见,但由于识别性能较差,情绪影响未被检测到。这些结果表明,音频 LLM 在做出临床决策时,可能会基于患者的声音特征而非医学证据进行决策,这会加剧医疗差异。我们得出结论,在临床部署这些模型之前,必须急需构建偏见感知型架构。

关键词

引用

@article{arxiv.2511.06592,
  title  = {MedVoiceBias: A Controlled Study of Audio LLM Behavior in Clinical Decision-Making},
  author = {Zhi Rui Tam and Yun-Nung Chen},
  journal= {arXiv preprint arXiv:2511.06592},
  year   = {2025}
}