波兰语-英语医学文本的统计机器翻译
计算与语言
2015-09-30 v1 信息检索
机器学习
摘要
这项新研究探讨了各种训练方法对面向医学文本的波兰语到英语统计机器翻译系统的影响。来自OPUS项目的EMEA平行文本语料库的各种元素被用作短语表和语言模型训练以及翻译系统开发、调优和测试的基础。使用BLEU、NIST、METEOR、RIBES和TER度量标准评估了各种系统和数据准备对翻译结果的影响。我们的实验包括了使用词性标注、因子化短语模型、层次模型、句法标注器以及许多不同对齐方法的系统。我们还对波兰语数据进行了深入分析,作为自动数据校正(如真大小写转换和标点规范化阶段)的准备工作。
引用
@article{arxiv.1509.08909,
title = {Polish -English Statistical Machine Translation of Medical Texts},
author = {Krzysztof Wołk and Krzysztof Marasek},
journal= {arXiv preprint arXiv:1509.08909},
year = {2015}
}
备注
New Research in Multimedia and Internet Systems, Springer. 09/2014, ISSN: 1867-5662. arXiv admin note: text overlap with arXiv:1509.08874