中文

有偏 oracle:评估 LLM 在医学诊断中的可理解性与同情心

计算与语言 2025-11-04 v1

摘要

大型语言模型 (LLM) 在通过生成解释和指导来支持临床医生进行诊断沟通方面显示出前景。然而,其产出内容是否既可理解又充满同情心仍存疑问。我们对两种主流 LLM 在医学诊断情景下进行评估,通过可读性指标衡量可理解性,通过 LLM-as-a-Judge 评分评估同情心,并与人类评估进行比较。结果表明,LLM 会针对患者的社会人口学变量和病情情况进行解释调整。然而,它们也会生成过于复杂的内容,并表现出偏向性的情感同情,从而导致可达性和支持不均衡。这凸显了系统校准以确保公平患者沟通的必要性。该项目的代码和数据已公开释放:https://github.com/Jeffateth/Biased_Oracle

关键词

引用

@article{arxiv.2511.00924,
  title  = {The Biased Oracle: Assessing LLMs' Understandability and Empathy in Medical Diagnoses},
  author = {Jianzhou Yao and Shunchang Liu and Guillaume Drui and Rikard Pettersson and Alessandro Blasimme and Sara Kijewski},
  journal= {arXiv preprint arXiv:2511.00924},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025 GenAI4Health Workshop