中文

多语言 LLM 基于医疗问答的差异性研究

计算与语言 2025-10-21 v1

摘要

将 AI 融入医疗领域时,公平获取可靠健康信息至关重要。然而,信息质量在不同语言之间存在差异,这引发了对多语言大型语言模型(LLM)可靠性和一致性的担忧。我们系统性地检查了大语言模型在多语言医疗问答中关于预训练来源和事实对齐的跨语言差异,涵盖英语、德语、土耳其语、中文(普通话)和意大利语。我们(i)构建了多语言医疗维基百科数据集(MultiWikiHealthCare);(ii)分析了跨语言的医疗覆盖范围;(iii)评估了 LLM 回答与这些参考资料的对齐情况;(iv)通过使用情境信息和检索增强生成(RAG)进行事实对齐进行案例研究。我们的发现表明,维基百科的覆盖范围以及 LLM 的事实对齐在跨语言上存在显著差异。在各种 LLM 中,即使提示词为非英语,回答也更倾向于对齐英语维基百科。在推理时提供来自非英语维基百科的情境片段,能够有效地将事实对齐引向与该语言文化相关的知识。这些结果为构建面向医疗领域的更具平等性、多语言 AI 系统提供了实际的实现路径。

关键词

引用

@article{arxiv.2510.17476,
  title  = {Disparities in Multilingual LLM-Based Healthcare Q&A},
  author = {Ipek Baris Schlicht and Burcu Sayin and Zhixue Zhao and Frederik M. Labonté and Cesare Barbera and Marco Viviani and Paolo Rosso and Lucie Flek},
  journal= {arXiv preprint arXiv:2510.17476},
  year   = {2025}
}

备注

Under review