通过 LLMs-as-the-Judge 改进生物医学关系抽取中大型语言模型的自动评估
计算与语言
2025-06-03 v1
摘要
大型语言模型在生物医学关系抽取中展现了出色的性能,即使在零样本场景下亦如此。然而,由于 LLM 能够生成类人文本,常产生标准答案的同义词或缩写,使得传统自动评估指标不可靠,因此在此任务中评估 LLM 仍具挑战性。另一方面,虽然人工评估更可靠,但其成本高且耗时,在实际应用中不切实际。本文研究使用 LLMs-as-the-Judge 作为生物医学关系抽取的替代评估方法。我们将 8 个 LLM 作为评判者,评估 5 个其他 LLM 在 3 个生物医学关系抽取数据集上生成的回复。与其他文本生成任务不同,我们观察到基于 LLM 的评判者在生物医学关系抽取任务中表现相当差(准确率通常低于 50%)。我们的发现表明,这主要是因为 LLM 抽取的关系不遵循任何标准格式。为解决此问题,我们提出对 LLM 生成的回复进行结构化输出格式化,帮助 LLM-Judge 将性能提升约 15%(平均)。我们还引入了一种领域自适应技术,通过在数据集间有效迁移知识来进一步增强 LLM-Judge 的性能。我们在此公开发布人工标注和 LLM 标注的判断数据(共 36k 样本):https://github.com/tahmedge/llm_judge_biomedical_re。
引用
@article{arxiv.2506.00777,
title = {Improving Automatic Evaluation of Large Language Models (LLMs) in Biomedical Relation Extraction via LLMs-as-the-Judge},
author = {Md Tahmid Rahman Laskar and Israt Jahan and Elham Dolatabadi and Chun Peng and Enamul Hoque and Jimmy Huang},
journal= {arXiv preprint arXiv:2506.00777},
year = {2025}
}
备注
Accepted at ACL 2025 (Main Conference)