面向生物医学数据的多语言神经机器翻译模型
计算与语言
2020-08-10 v1 机器学习
摘要
我们发布了一个多语言神经机器翻译模型,可用于翻译生物医学领域的文本。该模型可将 5 种语言(法语、德语、意大利语、韩语和西班牙语)翻译为英语。它使用大量通用与生物医学数据,并采用领域标签进行训练。我们的基准测试表明,该模型在新闻(通用领域)与生物医学测试集上均接近 SOTA 水平,且优于现有公开发布的模型。我们相信此次发布将有助于对 COVID-19 危机及其对社会、经济与医疗政策影响的数字内容进行大规模多语言分析。我们还发布了一个韩英生物医学文本测试集,包含来自官方指南与近期论文的 758 个句子,全部关于 COVID-19。
引用
@article{arxiv.2008.02878,
title = {A Multilingual Neural Machine Translation Model for Biomedical Data},
author = {Alexandre Bérard and Zae Myung Kim and Vassilina Nikoulina and Eunjeong L. Park and Matthias Gallé},
journal= {arXiv preprint arXiv:2008.02878},
year = {2020}
}
备注
https://github.com/naver/covid19-nmt