面向对话的个性化与文档级机器翻译
计算与语言
2021-02-23 v1
摘要
最先进的(SOTA)神经机器翻译(NMT)系统在句子级翻译文本,忽略上下文:包括前一句子在内的文本内信息,以及说话者性别等文本外信息。因此,一些句子被错误翻译。个性化 NMT (PersNMT) 与文档级 NMT (DocNMT) 将此类信息纳入翻译过程。这两个领域相对较新且既往相关工作有限。此外,尚无现成鲁棒的评估指标,难以开发更优系统并追踪全局进展与比较不同方法。本论文提案聚焦于从五种语言(英语、巴西葡萄牙语、德语、法语和波兰语)的电视字幕中提取的对话领域的 PersNMT 与 DocNMT。 addressed 三大挑战:(1) 将文本外信息直接融入 NMT 系统;(2) 改进衔接手段的机器翻译;(3) PersNMT 与 DocNMT 的可靠评估。
引用
@article{arxiv.2102.10979,
title = {Towards Personalised and Document-level Machine Translation of Dialogue},
author = {Sebastian T. Vincent},
journal= {arXiv preprint arXiv:2102.10979},
year = {2021}
}
备注
Thesis Proposal, 6 pages, 7 figures, accepted to the EACL2021 Student Workshop