通过大规模翻译丰富低资源语言的生物医学知识
计算与语言
2023-01-31 v3 人工智能
摘要
生物医学数据和基准极具价值,但在越南语等英语以外的低资源语言中非常有限。在本文中,我们利用最先进的英越翻译模型来翻译并生成生物医学领域的预训练数据以及监督数据。得益于这种大规模翻译,我们引入了 ViPubmedT5,一种在来自高质量公共 PubMed 语料的 2000 万篇翻译摘要上训练的预训练 Encoder-Decoder Transformer 模型。ViPubMedT5 在摘要和首字母缩略词消歧两项不同的生物医学基准上展示了最先进的结果。此外,我们发布了 ViMedNLI——一个由 MedNLI 翻译而来并经人类专家仔细润色的越南语新 NLP 任务,使用最近公开的 En-vi 翻译模型,并对现有方法针对 ViPubmedT5 进行了评估。
引用
@article{arxiv.2210.05598,
title = {Enriching Biomedical Knowledge for Low-resource Language Through Large-Scale Translation},
author = {Long Phan and Tai Dang and Hieu Tran and Trieu H. Trinh and Vy Phan and Lam D. Chau and Minh-Thang Luong},
journal= {arXiv preprint arXiv:2210.05598},
year = {2023}
}