面向对话翻译的语篇平行语料库自动构建
计算与语言
2016-05-24 v1
摘要
本文提出一种自动构建用于对话机器翻译的平行语篇语料库的新方法。首先,从互联网爬取并收集平行字幕数据及其对应的单语电影剧本数据。然后,通过信息检索方法将剧本数据中的说话人、语篇边界等标签投影到其字幕数据上,以将单语语篇映射到双语文本。我们不仅评估了映射结果,还将说话人信息整合到翻译中。实验表明,所提方法在说话人和对话边界标注上分别达到81.79%和98.64%的准确率,且基于说话人的语言模型自适应可在翻译质量上获得约0.5个BLEU点的提升。最后,我们公开发布了约100K带有人工说话人和对话边界标注的平行语篇数据。
引用
@article{arxiv.1605.06770,
title = {Automatic Construction of Discourse Corpora for Dialogue Translation},
author = {Longyue Wang and Xiaojun Zhang and Zhaopeng Tu and Andy Way and Qun Liu},
journal= {arXiv preprint arXiv:1605.06770},
year = {2016}
}
备注
7 pages, 3 figures, LREC 2016