中文

CLINIC:评估医疗领域语言模型的多语言可信性

计算与语言 2025-12-15 v1

摘要

将语言模型(LMs)集成到医疗系统中,对于改善医疗流程和决策具有巨大前景。然而,其实际应用的一个关键障碍是缺乏对其可信性的可靠评估,尤其是在多语言医疗环境中。现有的 LMs 主要在高资源语言上训练,使其难以应对中资源和低资源语言中医疗查询的复杂性和多样性,给在语言多样性至关重要的全球医疗环境中部署它们带来了重大挑战。在这项工作中,我们提出了 CLINIC,一个用于评估医疗领域语言模型可信性的综合性多语言基准。CLINIC 系统地根据可信性的五个关键维度对 LMs 进行基准测试:真实性、公平性、安全性、鲁棒性和隐私性,通过 18 个多样化任务实现,涵盖 15 种语言(覆盖所有主要大洲),并包含一系列关键医疗主题,如疾病状况、预防措施、诊断测试、治疗、手术和药物。我们的广泛评估揭示了 LMs 在事实正确性方面存在困难,在人口统计和语言群体上表现出偏见,并且容易受到隐私泄露和对抗攻击。通过揭示这些不足,CLINIC 为提升 LMs 在多语言环境中的全球覆盖范围和安全性奠定了基础。

关键词

引用

@article{arxiv.2512.11437,
  title  = {CLINIC: Evaluating Multilingual Trustworthiness in Language Models for Healthcare},
  author = {Akash Ghosh and Srivarshinee Sridhar and Raghav Kaushik Ravi and Muhsin Muhsin and Sriparna Saha and Chirag Agarwal},
  journal= {arXiv preprint arXiv:2512.11437},
  year   = {2025}
}

备注

49 pages, 31 figures