由可比语料增强的 PJAIT 系统参与 IWSLT 2015 评测活动
计算与语言
2015-12-08 v1 机器学习
摘要
在本文中,我们试图在一组非常多样的语言对(双向)上改进统计机器翻译(SMT)系统:捷克语-英语、越南语-英语、法语-英语和德语-英语。为此,我们进行了翻译模型训练,为每对语言创建了训练设置的适配,并为我们的 SMT 系统获取了可比语料。采用了创新工具和数据适配技术。IWSLT 2015 评测活动所用的 TED 平行文本语料库被用于训练语言模型,以及开发、调优和测试系统。此外,我们准备了基于维基百科的可比语料供我们的 SMT 系统使用。该数据被指定为允许用于 IWSLT 2015 评测。我们探索了领域适配技术、对称化词对齐模型、无监督音译模型和 KenLM 语言建模工具的使用。为评估不同准备对翻译结果的影响,我们进行了实验并使用了 BLEU、NIST 和 TER 指标。我们的结果表明我们的方法对 SMT 质量产生了积极影响。
引用
@article{arxiv.1512.01639,
title = {PJAIT Systems for the IWSLT 2015 Evaluation Campaign Enhanced by Comparable Corpora},
author = {Krzysztof Wołk and Krzysztof Marasek},
journal= {arXiv preprint arXiv:1512.01639},
year = {2015}
}