中文

致可靠机器翻译:规模化大语言模型以实现关键错误检测与安全

计算与语言 2026-02-13 v1 人工智能

摘要

机器翻译 (MT) 在跨语言信息获取、公共政策沟通和公平知识传播中发挥着关键作用。然而,关键意义错误(如事实扭曲、意图逆转或偏见翻译)可能削弱多语种系统的可靠性、公平性和安全性。本文探讨了指令调优大语言模型 (LLM) 检测此类关键错误的能力,评估了不同参数规模的模型,并使用公开数据集进行测试。我们的发现表明,模型规模化和适应策略(零-shot、few-shot、微调)均可持续改进,优于仅编码器的基线模型如XLM-R和ModernBERT。我们认为,改进MT中的关键错误检测有助于构建更安全、更可信、更具社会责任感的信息系统,降低在高风险或支持语言环境中产生误information、误传达和语言伤害的风险。本工作将错误检测不仅定位为技术挑战,更视为实现公正和负责任多语种AI不可或缺的安全措施。该代码将在GitHub上公开。

关键词

引用

@article{arxiv.2602.11444,
  title  = {Towards Reliable Machine Translation: Scaling LLMs for Critical Error Detection and Safety},
  author = {Muskaan Chopra and Lorenz Sparrenberg and Rafet Sifa},
  journal= {arXiv preprint arXiv:2602.11444},
  year   = {2026}
}

备注

Accepted at ECIR 2026