大型语言模型能否派生新知识?面向生物学知识发现的动态基准
计算与语言
2026-03-05 v1 人工智能
摘要
最近的大型语言模型(LLM)智能体取得的进展在自动知识发现方面展现了巨大潜力。然而,对 AI 知识发现能力的严格评估仍然是关键挑战。现有基准主要依赖静态数据集,导致数据污染不可避免——模型在训练期间可能已见评估知识。此外,现代 LLM 的快速迭代周期使得静态基准很快过时,无法评估是否能够发现真正的新知识。为此,我们提出 DBench-Bio,一个动态且完全自动化的基准,用于评估 AI 的生物学知识发现能力。DBench-Bio 采用三阶段流程:(1)获取严谨权威的论文摘要;(2)利用 LLM 提取科学假设问题及其对应的发现性答案;(3)基于相关性、清晰度和中心性进行质量筛选。我们将该流程实例化以构建覆盖 12 个生物医学子领域的每月更新基准。对 SOTA 模型的大规模评估揭示了当前在发现新知识方面的局限性。我们的工作为评估 AI 系统新知识发现能力提供了首个动态、自动化框架,构建了一个为 AI 研究社区 catalyze 发展知识发现的活跃、演进型资源。
引用
@article{arxiv.2603.03322,
title = {Can Large Language Models Derive New Knowledge? A Dynamic Benchmark for Biological Knowledge Discovery},
author = {Chaoqun Yang and Xinyu Lin and Shulin Li and Wenjie Wang and Ruihan Guo and Fuli Feng and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2603.03322},
year = {2026}
}