中文

利用深度学习方法从翻译记忆中预测锚定词以辅助机器翻译

计算与语言 2024-09-27 v1 人工智能 机器学习

摘要

翻译记忆(TM)是专业翻译工具(称为计算机辅助翻译(CAT)工具)的支柱。为了使用 CAT 工具进行翻译,译员利用 TM 来收集与待翻译片段(s')相似的翻译。许多 CAT 工具提供模糊匹配算法来定位 TM 中与 s' 距离相近的片段(s)。定位到两个相似片段后,CAT 工具将呈现平行片段(s, t),其中包含源语言片段及其目标语言翻译。此外,CAT 工具包含模糊匹配修复(FMR)技术,该技术自动使用平行片段从 TM 创建新的 TM 条目,其中包含原始片段的修改版本,其目的是作为 s' 的翻译。大多数 FMR 技术使用机器翻译作为“修复”那些需要修改的词语的方式。在本文中,我们表明,对于大部分锚定词,可以使用其他基于机器学习的方法(如 Word2Vec、BERT,甚至 ChatGPT)来修复。具体来说,我们表明,对于遵循连续词袋(CBOW)范式的锚定词,Word2Vec、BERT 和 GPT-4 可用于实现与神经机器翻译相似的结果,并且在某些情况下,在将锚定词从法语翻译成英语时,效果更好。

关键词

引用

@article{arxiv.2409.17939,
  title  = {Predicting Anchored Text from Translation Memories for Machine Translation Using Deep Learning Methods},
  author = {Richard Yue and John E. Ortega},
  journal= {arXiv preprint arXiv:2409.17939},
  year   = {2024}
}

备注

AMTA 2024 - The Association for Machine Translation in the Americas organizes biennial conferences devoted to researchers, commercial users, governmental and NGO users