基于问题特定奖励的无参考域适应用于含噪问题的翻译
计算与语言
2023-10-25 v1 人工智能
机器学习
摘要
社区问答(CQA)门户是帮助组织内用户的宝贵工具。然而,使其对非英语用户可及仍是一项挑战。翻译问题可拓宽社区覆盖面,惠及各语言中具相似疑问的个人。使用神经机器翻译(NMT)翻译问题带来更多挑战,尤其在含噪环境中,问题的语法正确性未被监控。这些问题可能被非母语者表述为陈述句,主谓顺序错误,有时甚至缺失问号。由于数据的含噪性质,从此类数据创建合成平行语料库亦十分困难。为解决该问题,我们提出一种仅使用源端数据微调NMT系统的训练方法。我们的方法通过结合BERTScore与掩码语言模型(MLM)分数的损失函数平衡充分性与流畅性。我们的方法超越了依赖合成目标数据的传统基于最大似然估计(MLE)的微调方法,取得了1.9 BLEU分数的提升。当我们向基线加入噪声时,我们的模型表现出鲁棒性,仍取得1.1 BLEU提升及TER与BLEURT指标上的大幅改进。我们提出的方法与模型无关,且仅在训练阶段需要。我们在 \url{https://www.iitp.ac.in/~ai-nlp-ml/resources.html#DomainAdapt} 公开代码与数据集以促进进一步研究。
引用
@article{arxiv.2310.15259,
title = {Reference Free Domain Adaptation for Translation of Noisy Questions with Question Specific Rewards},
author = {Baban Gain and Ramakrishna Appicharla and Soumya Chennabasavaraj and Nikesh Garera and Asif Ekbal and Muthusamy Chelliah},
journal= {arXiv preprint arXiv:2310.15259},
year = {2023}
}
备注
Published at: Findings of EMNLP 2023