中文

远程医疗作为机器翻译的一个特例

计算与语言 2015-10-16 v1

摘要

机器翻译在质量方面发展相当迅速。如今,我们有多种可用的网络机器翻译系统,能提供合理的翻译。然而,这些系统并不完美,在特定领域其质量可能下降。本文考察了用于医学数据的波兰语-英语统计机器翻译系统中不同训练方法的效果。大量 EMEA 平行文本语料库的元素以及不相关的 OPUS Open Subtitles 项目被用作创建短语表与不同语言模型的基础,包括这些翻译系统的开发、调优和测试。使用 BLEU、NIST、METEOR 和 TER 指标来评估各系统的结果。我们的实验涉及包含词性标注、因子短语模型、层次模型、句法标注器以及其他对齐方法的系统。我们还对波兰语数据进行了深度分析,作为自动化数据处理(如真值大小写还原或标点规范化阶段)之前的准备工作。使用归一化指标比较结果。低于 15% 的分数意味着机器翻译引擎无法提供令人满意的质量,高于 30% 的分数意味着翻译应当毫无问题地可理解,超过 50 的分数反映恰当的翻译。波兰语到英语翻译的 BLEU、NIST、METEOR 和 TER 分数平均结果相对较高,范围从 70,58 到 82,72。最低分数为 64,38。英语到波兰语翻译的平均结果范围略低 (67,58 - 78,97)。所呈现的高质量机器翻译系统在真实场景中的实现有望应用于常规医疗实践和远程医疗。

关键词

引用

@article{arxiv.1510.04600,
  title  = {Telemedicine as a special case of Machine Translation},
  author = {Krzysztof Wołk and Krzysztof Marasek and Wojciech Glinkowski},
  journal= {arXiv preprint arXiv:1510.04600},
  year   = {2015}
}