面向生物医学知识整理的上下文学习、微调与监督学习基准测试与分析:以生物兴趣化学实体为重点的研究
摘要
生物医学本体的自动化知识整理是确保其保持全面、高质量和最新的关键。在基础语言模型时代,本研究比较并分析了用于整理任务的三个NLP范式:上下文学习(ICL)、微调(FT)和监督学习(ML)。使用生物兴趣化学实体(ChEBI)数据库作为模型本体,设计了三个整理任务。对于ICL,采用了三种提示策略与GPT-4、GPT-3.5、BioGPT配合使用。选择PubmedBERT用于FT范式。对于ML,利用六个嵌入模型来训练随机森林和长短期记忆模型。设计了五种设置以评估ML和FT模型在不同数据可用性场景下的表现。整理任务的数据集包括:任务1(620,386)、任务2(611,430)和任务3(617,381),保持50:50的正负样本比例。对于ICL模型,GPT-4在任务1-3中分别取得了0.916、0.766和0.874的最佳准确率。在直接比较中,ML(在约260,000个三元组上训练)在所有任务中的准确率均优于ICL(准确率差异:+.11、+.22和+.17)。微调的PubmedBERT在任务1和2中的表现与领先的ML模型相似(F1差异:-.014和+.002),但在任务3中表现较差(-.048)。模拟表明,在训练数据较少且高度不平衡时,ML和FT模型的性能均有所下降,此时ICL(特别是GPT-4)在任务1和3中表现优异。GPT-4在任务1和3中,使用少于6,000个三元组时表现优异,超越了ML/FT。在任务2中,ICL的表现不如ML/FT。具有正确提示的ICL增强基础模型可以成为知识整理的好助手,然而,这并未使ML和FT范式过时。后两者需要特定任务的数据才能超越ICL。在这种情况下,ML依赖于小型预训练嵌入,从而最小化计算需求。
引用
@article{arxiv.2312.12989,
title = {Benchmarking and Analyzing In-context Learning, Fine-tuning and Supervised Learning for Biomedical Knowledge Curation: a focused study on chemical entities of biological interest},
author = {Emily Groves and Minhong Wang and Yusuf Abdulle and Holger Kunz and Jason Hoelscher-Obermaier and Ronin Wu and Honghan Wu},
journal= {arXiv preprint arXiv:2312.12989},
year = {2023}
}
备注
26 pages, 5 figures, 14 tables