基于大语言模型的生物学指代消解基准测试 BioCoref
计算与语言
2025-10-30 v1 机器学习
摘要
生物学文本中的指代消解面临独特挑战,包括复杂的领域特定术语、提及形式的高度模糊性以及指代表达式之间的长程依赖。本 work 提出了对生成式大语言模型(LLM)在生物学领域进行指代消解全面评估。我们以 CRAFT 语料库作为基准,对 LLMs 的性能进行评估,采用四种不同的提示策略,这些策略利用了局部信息、上下文丰富化以及诸如缩写和实体词典等领域特定线索。我们将这些方法与基于判别式跨度编码器 SpanBERT 进行基准测试,以比较生成式与判别式方法的有效性。我们的结果表明,尽管 LLMs 在表面层面的指代消解方面表现出色,尤其是在辅以领域 grounding 提示后,但其性能仍对长程上下文和提及的模糊性较为敏感。值得注意的是,LLaMA 8B 和 17B 模型在实体增强提示下表现出更高的精确率和 F1 分数,凸显了轻量级提示工程在生物医学 NLP 任务中提升 LLM 效用的潜力。
引用
@article{arxiv.2510.25087,
title = {BioCoref: Benchmarking Biomedical Coreference Resolution with LLMs},
author = {Nourah M Salem and Elizabeth White and Michael Bada and Lawrence Hunter},
journal= {arXiv preprint arXiv:2510.25087},
year = {2025}
}