中文

面向神经机器翻译的最优语料感知训练

机器学习 2025-08-08 v1 人工智能

摘要

语料感知训练 (CAT) 通过在训练时将语料信息注入每个训练样本,从而在训练过程中利用有价值的语料元数据,这在文献中被证明是有效的,通常被称为“标记”方法。经过 CAT 训练的模型能够直接从数据中学习语料库之间的质量、领域和细微差别,并能轻松切换到不同的推理行为。为了达到最佳评估效果,CAT 模型在训练开始前会预定义一组高质量数据,这容易出错且效率低下。在这项工作中,我们提出了最优语料感知训练 (OCAT),它通过冻结大部分模型参数并仅调整一小部分与语料相关的参数来微调 CAT 预训练模型。我们证明 OCAT 是轻量级的、对过拟合具有鲁棒性,并且能有效提升模型精度。我们使用 WMT23 英语到中文和英语到德语的翻译任务作为测试平台,结果显示,与普通训练相比,chrF 分别提升了 +3.6 和 +1.8。此外,我们的方法与其他最先进的微调技术性能相当或略优,同时对超参数设置不那么敏感。

关键词

引用

@article{arxiv.2508.05364,
  title  = {Optimal Corpus Aware Training for Neural Machine Translation},
  author = {Yi-Hsiu Liao and Cheng Shen and Brenda and Yang},
  journal= {arXiv preprint arXiv:2508.05364},
  year   = {2025}
}