超越字面映射:非文字翻译评估的基准测试与改进
计算与语言
2026-04-17 v2
摘要
大型语言模型(LLM)已显著推进机器翻译(MT),并被应用于社交网络服务、文学等语言复杂领域。在这些场景下,翻译常需处理非文字表达,导致MT指标不准。为系统性地检验MT指标的可靠性,我们首先构建了聚焦非文字翻译的元评估数据集,即MENT。MENT涵盖四个非文字翻译领域,包含来自多种MT系统的翻译,配有7,530条人工标注的翻译质量分数。实验结果揭示了传统MT指标的不准确性以及LLM作为评判器的局限性,尤其是知识截止和评分不一致问题。为缓解这些局限,我们提出了RATE——一种新型代理翻译评估框架,核心为一个反思型核心代理,动态调用专门子代理。实验表明,RATE至少比当前方法在系统级和分段级相关性提升了3.2分。进一步实验表明,RATE对通用领域MT评估具有鲁棒性。代码与数据集已公开:https://github.com/BITHLP/RATE。
引用
@article{arxiv.2601.07338,
title = {Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation},
author = {Yanzhi Tian and Cunxiang Wang and Zeming Liu and Heyan Huang and Wenbo Yu and Dawei Song and Jie Tang and Yuhang Guo},
journal= {arXiv preprint arXiv:2601.07338},
year = {2026}
}
备注
Accepted to ACL 2026 Main Conference