通过迁移学习考察大规模多语言预训练机器翻译模型在临床领域的应用
计算与语言
2023-06-06 v2 人工智能
摘要
近年来大规模多语言预训练语言模型(MMPLM)被开发出来,展现出强大能力及其为下游任务获取的先验知识。本工作考察 MMPLM 能否通过迁移学习应用于临床领域机器翻译(MT),面向完全未见过的语言。我们使用 Meta-AI 的 MMPLM “wmt21-dense-24-wide-en-X 与 X-en(WMT21fb)”开展实验研究,这些模型在 7 个语言对、14 个翻译方向上预训练,包括英语到捷克语、德语、豪萨语、冰岛语、日语、俄语、汉语及其反方向。我们将这些 MMPLM 微调至英语-\textit{西班牙语}语言对,该语言对在其原始预训练语料中\textit{完全不存在},分别采用隐式与显式方式。我们为此次微调精心准备了对齐的\textit{临床}领域数据,这不同于其原始混合领域知识。实验结果表明,仅使用 25 万条对齐良好的领域内英西(EN-ES)句段,在三项子任务翻译测试——临床病例、临床术语与本体概念上,微调即非常成功。其评估分数与 Meta-AI 另一包含西班牙语作为高资源设定的预训练 MMPLM NLLB 极为接近。据我们所知,这是首个在预训练期间完全未见语言上成功使用 MMPLM 进行\textit{临床领域迁移学习神经机器翻译}的工作。
引用
@article{arxiv.2210.06068,
title = {Investigating Massive Multilingual Pre-Trained Machine Translation Models for Clinical Domain via Transfer Learning},
author = {Lifeng Han and Gleb Erofeev and Irina Sorokina and Serge Gladkoff and Goran Nenadic},
journal= {arXiv preprint arXiv:2210.06068},
year = {2023}
}
备注
Accepted to ClinicalNLP-2023 WS@ACL-2023