中文

INarIG:用于词级自动补全的迭代非自回归指令生成模型

计算与语言 2023-12-01 v1

摘要

计算机辅助翻译(CAT)旨在提升人工翻译效率,在机器翻译无法满足质量要求的场景中仍十分重要。该领域的一项基础任务是词级自动补全(WLAC)。WLAC 在给定源句、翻译上下文以及人工键入字符序列的情况下预测目标词。先前工作要么采用词分类模型以利用目标词两侧的上下文信息,要么直接忽略来自右侧上下文的依赖。此外,关键信息即人工键入序列仅在解码模块中用作前缀约束。本文中,我们提出 INarIG(Iterative Non-autoregressive Instruct Generation,迭代非自回归指令生成)模型,其将人工键入序列构建为指令单元,并采用基于子词的迭代解码以充分利用任务中给定的输入信息。我们的模型更擅长处理低频词(本任务的核心场景),并在 WMT22 与基准数据集上取得 SOTA 结果,预测准确率最大提升超 10%。

关键词

引用

@article{arxiv.2311.18200,
  title  = {INarIG: Iterative Non-autoregressive Instruct Generation Model For Word-Level Auto Completion},
  author = {Hengchao Shang and Zongyao Li and Daimeng Wei and Jiaxin Guo and Minghan Wang and Xiaoyu Chen and Lizhi Lei and Hao Yang},
  journal= {arXiv preprint arXiv:2311.18200},
  year   = {2023}
}

备注

EMNLP2023