前沿大语言模型能否替代生物医学文本挖掘中的标注人员?分析挑战并探索解决方案
计算与语言
2025-05-20 v2
摘要
多项先前研究已报告大语言模型(LLM)在生物医学文本挖掘中表现不佳。通过分析这些评估中的失败模式,我们识别出大语言模型在生物医学语料库中的三个主要挑战:(1) 大语言模型无法从监督数据中学习数据集特定的隐含细微差别;(2) 判别式任务的通用格式要求限制了大语言模型的推理能力,尤其是缺乏测试时计算能力的大语言模型;(3) 大语言模型难以遵循标注规范并匹配精确模式,这阻碍了其理解生物医学标注工作流中详细标注要求的能力。我们针对上述问题实验了提示工程技术,并开发了一个从标注规范中动态提取指令的流水线。我们的结果表明,前沿大语言模型可以在极少依赖人工标注数据且无需微调的情况下,接近或超越SOTA基于BERT的模型的性能。此外,我们对一个闭源大语言模型进行了模型蒸馏,证明仅使用大语言模型标注的合成数据训练的BERT模型也能达到实用性能。基于这些发现,我们探讨了在生物医学文本挖掘生产场景中部分替代人工标注的可行性。
引用
@article{arxiv.2503.03261,
title = {Can Frontier LLMs Replace Annotators in Biomedical Text Mining? Analyzing Challenges and Exploring Solutions},
author = {Yichong Zhao and Susumu Goto},
journal= {arXiv preprint arXiv:2503.03261},
year = {2025}
}