成语双句:评估大语言模型的谚语翻译能力
计算与语言
2025-01-22 v1
摘要
尽管机器翻译取得了显著成就,但在翻译语言中文化元素方面(如习语、谚语和口语表达)的研究仍属未探索之地。本文考察了最新神经机器翻译 (NMT) 和大语言模型 (LLM) 在翻译谚语方面的能力,这些谚语深植于文化语境中。我们构建了一个包含单句谚语和对话中谚语的翻译数据集,覆盖四种语言对。我们的实验表明,所研究的模型在文化背景相似的语言之间能够取得良好的翻译效果,LLM 通常在谚语翻译中优于 NMT 模型。此外,我们发现当前的自动评估指标(如 BLEU、CHRF++ 和 COMET)不足以可靠地评估谚语翻译质量,凸显了需要更具文化意识的评估指标的需求。
引用
@article{arxiv.2501.11953,
title = {Proverbs Run in Pairs: Evaluating Proverb Translation Capability of Large Language Model},
author = {Minghan Wang and Viet-Thanh Pham and Farhad Moghimifar and Thuy-Trang Vu},
journal= {arXiv preprint arXiv:2501.11953},
year = {2025}
}