“AI”能当医生吗?临床大语言模型的共情、可读性与对齐研究
计算与语言
2026-04-23 v1 人工智能
摘要
大语言模型(LLMs)在医疗保健领域的部署日益增多,然而其与临床标准的沟通对齐程度仍未得到充分量化。我们对通用和领域专用的大语言模型在结构化医学解释和真实世界医患互动中进行了多维评估,分析了语义保真度、可读性和情感共鸣。基线模型相对于医生放大了情感极性(非常负面:43.14-45.10% vs. 37.25%),并且在像GPT-5和Claude这样的大型架构中,产生的语言复杂度显著更高(FKGL高达16.91-17.60 vs. 医生撰写回答的11.47-12.50)。以共情为导向的提示减少了极端负面情绪并降低了年级水平复杂度(GPT-5最多降低-6.87 FKGL分),但并未显著提高语义保真度。协作式重写产生了最强的整体对齐效果。改写配置实现了与医生回答最高的语义相似度(均值高达0.93),同时持续改善了可读性并降低了情感极端性。双重利益相关者评估显示,没有模型在认知标准上超越医生,而患者则一致偏好改写后的变体,因其清晰度和情感基调更佳。这些发现表明,大语言模型作为协作式沟通增强工具最为有效,而非临床专业知识的替代品。
引用
@article{arxiv.2604.20791,
title = {Can "AI" Be a Doctor? A Study of Empathy, Readability, and Alignment in Clinical LLMs},
author = {Mariano Barone and Francesco Di Serio and Roberto Moio and Marco Postiglione and Giuseppe Riccio and Antonio Romano and Vincenzo Moscato},
journal= {arXiv preprint arXiv:2604.20791},
year = {2026}
}