中文

面向生物医学数据的多语言神经机器翻译模型

计算与语言 2020-08-10 v1 机器学习

摘要

我们发布了一个多语言神经机器翻译模型,可用于翻译生物医学领域的文本。该模型可将 5 种语言(法语、德语、意大利语、韩语和西班牙语)翻译为英语。它使用大量通用与生物医学数据,并采用领域标签进行训练。我们的基准测试表明,该模型在新闻(通用领域)与生物医学测试集上均接近 SOTA 水平,且优于现有公开发布的模型。我们相信此次发布将有助于对 COVID-19 危机及其对社会、经济与医疗政策影响的数字内容进行大规模多语言分析。我们还发布了一个韩英生物医学文本测试集,包含来自官方指南与近期论文的 758 个句子,全部关于 COVID-19。

关键词

引用

@article{arxiv.2008.02878,
  title  = {A Multilingual Neural Machine Translation Model for Biomedical Data},
  author = {Alexandre Bérard and Zae Myung Kim and Vassilina Nikoulina and Eunjeong L. Park and Matthias Gallé},
  journal= {arXiv preprint arXiv:2008.02878},
  year   = {2020}
}

备注

https://github.com/naver/covid19-nmt