资源受限环境下医学语境中的语言模型评估
计算与语言
2024-10-25 v2 人工智能
摘要
自 Transformer 架构出现以来,语言模型开发迅速发展, driven by their promising potential。将这些模型发布到生产环境需要充分理解其行为,尤其是在像医疗这样敏感的领域。尽管如此,医学文献仍缺乏对预训练语言模型的实用评估,而这些模型在仅能使用消费级计算资源的setting中尤为宝贵。为填补这一空白,我们进行了一次全面调查,评估了医学领域中的语言模型,并对其进行医学文本分类和条件文本生成评估。该子集包括 53 个模型,参数量从 1.1 亿到 130 亿,涵盖 Transformer 架构及知识领域。针对文本分类采用不同方法,包括零样本学习,无需训练模型即可进行微调。这些方法对我们的目标setting非常有帮助,许多语言模型的用户正是处于这种情况下。结果显示,在所评估的任务和数据集上表现出惊人的性能,彰显了某些模型即使没有领域专业化也能包含医学知识的潜力。该研究因此倡导进一步探索在资源受限的医疗环境中应用模型的可能性,以惠及广大用户。代码已在 https://github.com/anpoc/Language-models-in-medicine 上提供。
关键词
引用
@article{arxiv.2406.16611,
title = {Evaluation of Language Models in the Medical Context Under Resource-Constrained Settings},
author = {Andrea Posada and Daniel Rueckert and Felix Meissen and Philip Müller},
journal= {arXiv preprint arXiv:2406.16611},
year = {2024}
}