基于相似度衰减的对比标记学习用于机器翻译中的重复抑制
计算与语言
2024-10-01 v1 人工智能
摘要
对于跨语言对话和贸易,神经机器翻译 (NMT) 至关重要,但仍面临生成内容单调和重复的挑战。传统解决方案依赖惩罚文本冗余或标记重复出现,效果有限,尤其是在具有内在冗余的长篇文章和电商描述中,尽管出现了大型语言模型 (LLM)。本文通过信息熵视角探讨文本重复的根本原因,将现象归因于输入文本的高不确定性。为此,提出了一种名为对比标记学习伴随相似度衰减 (CTSD) 的新型算法,通过动态调节标记抑制程度来应对,这种抑制程度受注意力权重和标记间距离影响。此外,编译了一个由在线真实商品标题文本组成的电商数据集,易受幻觉翻译影响,用于基准测试该算法。广泛的评估表明,CTSD 在精度和通用性方面显著优于现有方法。额外的在线 A/B 测试强化了其实际价值,显示用户参与度和转化率有显著提升。值得注意的是,该方法已在阿里巴巴.com 全球最大的 B2B 电商平台的八个多语言网站上实现了全流量。
引用
@article{arxiv.2409.19877,
title = {Contrastive Token Learning with Similarity Decay for Repetition Suppression in Machine Translation},
author = {Huangyu Dai and Ben Chen and Kaidi Chen and Ying Han and Zihan Liang and Wen Jiang},
journal= {arXiv preprint arXiv:2409.19877},
year = {2024}
}
备注
Accepted by EMNLP'24 Findings. 12 pages, 4 figures, 9 tables