脚本鸿沟:在真实场景中评估 LLM 对印度语言原生脚本与罗马化脚本的分诊能力
计算与语言
2026-04-01 v2 机器学习
摘要
大型语言模型(LLM)越来越多地被部署在印度高风险临床应用中。印度语言的使用者经常使用罗马化文本而非原生脚本进行交流,但现有研究很少在真实应用中量化或评估这种正字法变异。我们研究了罗马化如何影响 LLM 在一个关键领域——孕产妇和新生儿医疗分诊——中的可靠性。我们在涵盖五种印度语言和尼泊尔语的真实用户生成健康查询数据集上对主流 LLM 进行了基准测试。我们的结果表明,罗马化消息的性能持续下降,在各语言和模型之间差距高达 24 个百分点。我们提出并评估了一种基于不确定性的选择性路由方法,以弥合这一脚本鸿沟。仅在我们合作的孕产妇健康组织中,这一差距就可能导致近 200 万例分诊错误。我们的发现揭示了基于 LLM 的健康系统中的一个关键安全盲点:看似能理解罗马化输入的模型仍可能无法可靠地对其采取行动。
引用
@article{arxiv.2512.10780,
title = {Script Gap: Evaluating LLM Triage on Indian Languages in Native vs Romanized Scripts in a Real World Setting},
author = {Manurag Khullar and Utkarsh Desai and Poorva Malviya and Aman Dalmia and Zheyuan Ryan Shi},
journal= {arXiv preprint arXiv:2512.10780},
year = {2026}
}