中文

基于 Transformer 的生物医学语言模型的本地化领域适配

计算与语言 2023-07-12 v3 人工智能 机器学习

摘要

在数字医疗时代,医院每天产生的大量文本信息构成了一项重要但未被充分利用的资产,可以通过任务特定的、微调过的生物医学语言表示模型来开发该资产,从而改善患者护理和管理。对于此类特定领域,先前的研究表明,对源自广泛覆盖检查点的模型进行微调,可以通过在大规模领域内资源上进行额外训练轮次而大幅受益。然而,对于像意大利语这样资源较少的语言,这些资源通常是难以获取的,阻碍了本地医疗机构进行领域内适配。为了缩小这一差距,我们的工作研究了两种可行的方法来派生英语以外的生物医学语言模型,并以意大利语作为具体用例:一种基于英语资源的神经机器翻译,重数量轻质量;另一种基于原生用意大利语编写的高质量、窄范围语料库,重质量轻数量。我们的研究表明,对于生物医学适配,数据数量是比数据质量更严格的约束条件,但高质量数据的拼接可以提高模型性能,即使在处理规模相对有限的语料库时也是如此。我们研究中发布的模型有望为意大利的医院和学术界解锁重要的研究机会。最后,从该研究中获得的一系列经验教训为构建可推广到其他资源较少语言和不同领域设置的生物医学语言模型提供了解决方案的有价值见解。

关键词

引用

@article{arxiv.2212.10422,
  title  = {Localising In-Domain Adaptation of Transformer-Based Biomedical Language Models},
  author = {Tommaso Mario Buonocore and Claudio Crema and Alberto Redolfi and Riccardo Bellazzi and Enea Parimbelli},
  journal= {arXiv preprint arXiv:2212.10422},
  year   = {2023}
}

备注

8 pages, 2 figures, 6 tables. Published in Journal of Biomedical Informatics