中文

评估乌尔都语习语翻译的大型语言模型

计算与语言 2025-10-21 v1

摘要

习语翻译是机器翻译中的重要挑战,尤其是针对低资源语言如乌尔都语,已获得有限的关注。为推动该领域的研究,我们引入了首个针对乌尔都语到英语习语翻译的评估数据集,涵盖Native乌尔都语和Roman乌尔都语两种脚本,并附带黄金标准英语等效物。我们对评估多个开源大型语言模型(LLM)和神经机器翻译(NMT)系统进行评估,关注其在保持习语和文化含义方面的能力。采用BLEU、BERTScore、COMET和XCOMET等自动指标评估翻译质量。我们的发现表明,提示工程在习语翻译中优于直接翻译,尽管不同提示类型之间的性能差异相对较小。此外,跨脚本比较显示,文本表示对翻译质量有显著影响,Native乌尔都语输入比Roman乌尔都语产生更准确的习语翻译。

关键词

引用

@article{arxiv.2510.17460,
  title  = {Evaluating Large Language Models on Urdu Idiom Translation},
  author = {Muhammad Farmal Khan and Mousumi Akter},
  journal= {arXiv preprint arXiv:2510.17460},
  year   = {2025}
}