INarIG:用于词级自动补全的迭代非自回归指令生成模型
计算与语言
2023-12-01 v1
摘要
计算机辅助翻译(CAT)旨在提升人工翻译效率,在机器翻译无法满足质量要求的场景中仍十分重要。该领域的一项基础任务是词级自动补全(WLAC)。WLAC 在给定源句、翻译上下文以及人工键入字符序列的情况下预测目标词。先前工作要么采用词分类模型以利用目标词两侧的上下文信息,要么直接忽略来自右侧上下文的依赖。此外,关键信息即人工键入序列仅在解码模块中用作前缀约束。本文中,我们提出 INarIG(Iterative Non-autoregressive Instruct Generation,迭代非自回归指令生成)模型,其将人工键入序列构建为指令单元,并采用基于子词的迭代解码以充分利用任务中给定的输入信息。我们的模型更擅长处理低频词(本任务的核心场景),并在 WMT22 与基准数据集上取得 SOTA 结果,预测准确率最大提升超 10%。
引用
@article{arxiv.2311.18200,
title = {INarIG: Iterative Non-autoregressive Instruct Generation Model For Word-Level Auto Completion},
author = {Hengchao Shang and Zongyao Li and Daimeng Wei and Jiaxin Guo and Minghan Wang and Xiaoyu Chen and Lizhi Lei and Hao Yang},
journal= {arXiv preprint arXiv:2311.18200},
year = {2023}
}
备注
EMNLP2023