中文

计算机辅助翻译中基于能量的词级自动补全模型

计算与语言 2024-07-30 v1

摘要

词级自动补全(Word-level AutoCompletion, WLAC)是计算机辅助翻译中的一个值得关注却富有挑战性的任务。现有工作通过基于神经网络的分类模型来解决该任务,将输入上下文的隐藏向量映射到其对应的标签(即将候选目标词视为标签)。由于上下文隐藏向量本身不考虑标签信息,且通过线性分类器投影到标签上,该模型无法充分利用来自源句子的有价值信息(这一点在我们的实验中已验证),最终限制了其整体性能。为缓解这一问题,本文提出了一种基于能量的WLAC模型,该模型使上下文隐藏向量能够捕获来自源句子的关键信息。不幸的是,训练和推理面临效率和有效性挑战,因此我们采用三种简单且有效的策略来实现该模型。在四个标准基准上的实验表明,我们的重新排序方法比以前的最先进模型实现了约 6.07% 的显著性提升。进一步分析表明,我们方法的每个策略都为最终性能贡献了作用。

关键词

引用

@article{arxiv.2407.20083,
  title  = {An Energy-based Model for Word-level AutoCompletion in Computer-aided Translation},
  author = {Cheng Yang and Guoping Huang and Mo Yu and Zhirui Zhang and Siheng Li and Mingming Yang and Shuming Shi and Yujiu Yang and Lemao Liu},
  journal= {arXiv preprint arXiv:2407.20083},
  year   = {2024}
}

备注

Accepted to TACL 2024