LiTransProQA:基于 LLM 的文学翻译评估指标与专业问答
计算与语言
2025-10-14 v4 人工智能
摘要
大型语言模型(LLM)的影响已扩展到文学领域。然而,现有的文学评估指标优先考虑机械准确性而非艺术表达,并且倾向于高估机器翻译优于经验丰富的专业人员的人工翻译。从长远来看,这种偏差可能导致翻译质量和文化真实性的不可逆下降。为应对对专门文学评估指标的迫切需求,我们引入了 LITRANSPROQA,这是一种新颖的、无参考的、基于 LLM 的问答框架,专门用于文学翻译评估。LITRANSPROQA 将人类纳入循环以融入专业文学翻译人员和研究人员的见解,聚焦于文学质量评估中的关键要素,如文学修辞手法、文化理解和作者声音。我们广泛的评估表明,虽然针对文学微调的 XCOMET-XL 仅带来边际提升,但 LITRANSPROQA 显著优于当前指标,在充分性评估中实现了高达 0.07 的相关性增益,并超越最先进指标超过 15 个百分点。将专业翻译人员的见解作为权重纳入进一步提升了性能,突显了翻译人员输入的价值。值得注意的是,LITRANSPROQA 达到了与经过训练的语言学学生评估者相当的充分性性能,尽管它仍落后于经验丰富的专业翻译人员。LITRANSPROQA 对 LLaMA3.3-70b 和 Qwen2.5-32b 等开源模型展现出广泛适用性,表明其作为评估需要本地处理(由于版权或伦理考虑)的文学翻译的可访问且无需训练的工具的潜力。
引用
@article{arxiv.2505.05423,
title = {LiTransProQA: an LLM-based Literary Translation evaluation metric with Professional Question Answering},
author = {Ran Zhang and Wei Zhao and Lieve Macken and Steffen Eger},
journal= {arXiv preprint arXiv:2505.05423},
year = {2025}
}
备注
Accepted as a main paper at EMNLP 2025. CR version