中文

多参考译文搭配有意义变体提升文学机器翻译

机器学习 2024-12-30 v1 人工智能 密码学与安全

摘要

虽然单个源句可产生多种翻译方式,但大多数机器翻译(MT)模型仅使用单一参考译文进行训练。先前研究表明,使用合成改写可改善 MT。本文通过分析 Par3 数据集中不同英文译文之间的语义相似性,探讨多参考译文的最佳实践。我们将译文间的语义相似性分为低、中、高三个层级,对三种不同模型(mT5-large、LLaMA-2-7B 和 Opus-MT)进行文学 MT 任务微调。在不同模型下,保持总训练实例数不变,单参考但更多源文本仅在边缘超过多参考(源文本减半)的情况。此外,在微调大语言模型时,使用语义相似性为中等和高的改写译文优于未筛选的数据集,BLEU(提升 0.3-0.5)、COMET(提升 0.1-0.9)和 chrF++(提升 0.17-0.32)。我们的代码已公开于 GitHub。

关键词

引用

@article{arxiv.2412.18706,
  title  = {SurvAttack: Black-Box Attack On Survival Models through Ontology-Informed EHR Perturbation},
  author = {Mohsen Nayebi Kerdabadi and Arya Hadizadeh Moghaddam and Bin Liu and Mei Liu and Zijun Yao},
  journal= {arXiv preprint arXiv:2412.18706},
  year   = {2024}
}