生物医学与临床预训练模型适配法语长文档:一项比较研究
计算与语言
2024-02-27 v1 人工智能
摘要
近期,基于 BERT 的预训练语言模型已被引入法语生物医学领域。尽管这些模型在生物医学和临床自然语言处理(NLP)任务中取得了最先进(SOTA)的结果,但其受限于 512 个 token 的输入序列长度,这在应用于临床笔记时构成了挑战。本文提出了一项针对长序列模型的三种适配策略的比较研究,利用了 Longformer 架构。我们在涵盖生物医学和临床领域的 16 个下游任务上对这些模型进行了评估。研究结果表明,使用法语生物医学文本对英语临床模型进行进一步预训练,其表现优于将法语生物医学 BERT 转换为 Longformer 架构以及从头预训练法语生物医学 Longformer。结果强调,长序列法语生物医学模型在大多数下游任务中提升了性能,且不受序列长度影响,但基于 BERT 的模型在命名实体识别任务中仍然最为高效。
引用
@article{arxiv.2402.16689,
title = {Adaptation of Biomedical and Clinical Pretrained Models to French Long Documents: A Comparative Study},
author = {Adrien Bazoge and Emmanuel Morin and Beatrice Daille and Pierre-Antoine Gourraud},
journal= {arXiv preprint arXiv:2402.16689},
year = {2024}
}