中文

面向高资源与低资源语言的大型语言模型医学翻译多方法验证

计算与语言 2026-03-25 v1

摘要

语言障碍影响了 2730 万美国居民,而专业医学翻译成本高昂且常常不可得。我们评估了四个前沿大型语言模型 (GPT-5.1、Claude Opus 4.5、Gemini 3 Pro、Kimi K2) 将 22 份医学文件翻译成 8 种语言(包括高资源语言:西班牙语、中文、俄语、越南语;中资源语言:韩语、阿拉伯语;低资源语言:塔加洛语、海地克罗利语)所采用的五层验证框架。在 704 组翻译对中,所有模型实现了高语义保真度 (LaBSE 大于 0.92),且在高资源与低资源语言之间无显著差异 (p = 0.066)。跨模型回译确认结果并非由同一模型循环导致 (delta = -0.0009)。四个独立训练的模型之间的一致性高 (LaBSE: 0.946),词汇借用分析显示在低资源语言中,英文术语保留与忠实度评分之间无相关性 (rho = +0.018, p = 0.82)。这些交叉结果表明,前沿 LLM 在资源水平上均能保持医学语义,对于医疗保健的语言获取具有重要意义。

关键词

引用

@article{arxiv.2603.22642,
  title  = {Multi-Method Validation of Large Language Model Medical Translation Across High- and Low-Resource Languages},
  author = {Chukwuebuka Anyaegbuna and Eduardo Juan Perez Guerrero and Jerry Liu and Timothy Keyes and April Liang and Natasha Steele and Stephen Ma and Jonathan Chen and Kevin Schulman},
  journal= {arXiv preprint arXiv:2603.22642},
  year   = {2026}
}

备注

32 references, 5 tables, 2 figures