Multi-OphthaLingua:用于评估和去偏中低收入国家LLM眼科问答的多语言基准
计算与语言
2024-12-20 v1 人工智能
摘要
当前眼科临床工作流程受到过度转诊、等待时间长以及复杂且异质的医疗记录的困扰。大型语言模型(LLM)为自动化各种流程(如分诊、视力评估等初步测试以及报告摘要)提供了有前景的解决方案。然而,LLM在自然语言问答任务中不同语言的表现差异显著,可能加剧中低收入国家(LMIC)的医疗差距。本研究引入了第一个多语言眼科问答基准,包含跨语言平行的人工策划问题,允许直接进行跨语言比较。我们对7种不同语言上的6种流行LLM的评估揭示了不同语言之间的显著偏差,凸显了LLM在LMIC临床部署的风险。现有的去偏方法(如翻译思维链或检索增强生成(RAG))本身不足以缩小这一性能差距,通常无法在所有语言上提升性能,且缺乏医学领域的特异性。为解决此问题,我们提出了CLARA(跨语言反思性智能系统),一种利用检索增强生成和自我验证的新型推理时去偏方法。我们的方法不仅在所有语言上提升了性能,还显著缩小了多语言偏差差距,促进了LLM在全球的公平应用。
引用
@article{arxiv.2412.14304,
title = {Multi-OphthaLingua: A Multilingual Benchmark for Assessing and Debiasing LLM Ophthalmological QA in LMICs},
author = {David Restrepo and Chenwei Wu and Zhengxu Tang and Zitao Shuai and Thao Nguyen Minh Phan and Jun-En Ding and Cong-Tinh Dao and Jack Gallifant and Robyn Gayle Dychiao and Jose Carlo Artiaga and André Hiroshi Bando and Carolina Pelegrini Barbosa Gracitelli and Vincenz Ferrer and Leo Anthony Celi and Danielle Bitterman and Michael G Morley and Luis Filipe Nakayama},
journal= {arXiv preprint arXiv:2412.14304},
year = {2024}
}
备注
Accepted at the AAAI 2025 Artificial Intelligence for Social Impact Track (AAAI-AISI 2025)