阿拉伯语医学任务中大型语言模型的跨语言实证评估
计算与语言
2026-02-06 v1 机器学习
摘要
近年来,大型语言模型(Large Language Models, LLMs)在临床决策支持、医学教育和医学问答等医疗应用中广受欢迎。然而,这些模型往往以英语为中心,限制了其在语言资源丰富的社区中的鲁棒性和可靠性。近期研究已凸显在各种医学任务中,低资源语言的性能存在差异,但其背后原因仍鲜为人知。本研究对阿拉伯语和英语医学问答任务中 LLM 性能进行跨语言实证分析。我们的发现表明,语言驱动的性能差距随任务复杂度的增加而加剧。分词分析揭示了阿拉伯语医学文本的结构性碎片化,而可靠性分析则表明模型报告的置信度和解释与正确性的关联性有限。综上,这些发现凸显了在医疗任务中为 LLMs 进行语言感知设计与评估的必要性。
引用
@article{arxiv.2602.05374,
title = {Cross-Lingual Empirical Evaluation of Large Language Models for Arabic Medical Tasks},
author = {Chaimae Abouzahir and Congbo Ma and Nizar Habash and Farah E. Shamout},
journal= {arXiv preprint arXiv:2602.05374},
year = {2026}
}
备注
Accepted to HeaLing-EACL 2026