BioVerge: 生物医学假设生成中自评智能体的全方位基准与研究
计算与语言
2025-11-13 v1
摘要
生物医学研究中的假设生成传统上侧重于从庞大的科学文献中发现隐藏的关系,常采用文献发现(Literature-Based Discovery, LBD)等方法。尽管已有进展,但当前方法通常依赖单一数据类型或预定义的提取模式,限制了对新型复杂关联的发现。近期大型语言模型(LLM)智能体在信息检索、推理和生成方面展现出巨大潜力,但在生物医学假设生成中的应用受限于缺乏标准化数据集和执行环境。为此,我们引入 BioVerge,一个全方位基准测试及 BioVerge Agent 智能体框架,旨在为生物医学假设生成提供标准化环境,探索现有科学知识的前沿。我们的数据集包含从历史生物医学假设和 PubMed 文献中提取的结构化与文本数据,按需支持 LLM 智能体的探索。BioVerge Agent 采用基于 ReAct 的方法,包含独立的生成与评估模块,迭代性地生成并自我评估假设提案。通过大量实验,我们发现:1) 不同的 BioVerge Agent 架构影响探索多样性和推理策略;2) 结构化与文本信息源各提供独特且关键的上下文,提升假设生成效果;3) 自我评估显著改善提案假设的新颖性与相关性。
引用
@article{arxiv.2511.08866,
title = {BioVerge: A Comprehensive Benchmark and Study of Self-Evaluating Agents for Biomedical Hypothesis Generation},
author = {Fuyi Yang and Chenchen Ye and Mingyu Derek Ma and Yijia Xiao and Matthew Yang and Wei Wang},
journal= {arXiv preprint arXiv:2511.08866},
year = {2025}
}