中文

BioHopR:生物医学领域多跳多答案推理的基准

计算与语言 2025-06-10 v2

摘要

生物医学推理通常需要遍历药物、疾病和蛋白质等实体之间的相互关联关系。尽管大语言模型(LLM)日益受到关注,但现有的基准缺乏评估生物医学领域多跳推理的能力,尤其是对于涉及一对多和多对多关系的查询。这一空白使得生物医学多跳推理的关键挑战尚未得到充分探索。为了解决这一问题,我们引入了 BioHopR,这是一个旨在评估结构化生物医学知识图谱中多跳、多答案推理的新型基准。BioHopR 基于综合的 PrimeKG 构建,包含反映现实世界生物医学复杂性的 1 跳和 2 跳推理任务。对 SOTA 模型的评估表明,专注于推理的专有模型 O3-mini 在 1 跳任务上的准确率为 37.93%,在 2 跳任务上为 14.57%,优于 GPT4O 等专有模型以及包括 HuatuoGPT-o1-70B 和 Llama-3.3-70B 在内的开源生物医学模型。然而,所有模型在多跳性能上均表现出显著下降,凸显了在生物医学领域解决隐式推理步骤的挑战。通过填补生物医学领域多跳推理基准的空白,BioHopR 为评估推理能力设定了新标准,突出了专有模型与开源模型之间的关键差距,同时为未来生物医学 LLM 的进步铺平了道路。

关键词

引用

@article{arxiv.2505.22240,
  title  = {BioHopR: A Benchmark for Multi-Hop, Multi-Answer Reasoning in Biomedical Domain},
  author = {Yunsoo Kim and Yusuf Abdulle and Honghan Wu},
  journal= {arXiv preprint arXiv:2505.22240},
  year   = {2025}
}