中文

持续知识代谢:从演化文献生成科学假设

计算与语言 2026-04-15 v1 人工智能

摘要

科学假设生成需要追踪知识的演化,而不仅仅是当前已知的知识。我们引入持续知识代谢 (CKM) 框架,通过滑动时间窗口处理科学文献,并在新发现到达时逐步更新结构化知识库。我们 present CKM-Lite 一种高效变体,通过增量积累实现强预测覆盖, 在命中率 (+2.8%, p=0.006)、假设产量 (+3.6, p<0.001) 和最佳匹配对齐 (+0.43, p<0.001) 上 outperform batch 处理,同时将 token 成本降低92%。为理解这些差异的驱动因素,我们 develop CKM-Full,一种具有仪器化功能的变体,将每个新发现分类为 novel、confirm 或 contradict,检测知识变化信号,并以完整演化轨迹为假设生成条件。分析 CKM-Full 在50个 research topics 上生成的892个假设,以及其他变体的平行运行,我们报告四个经验观察:(1)增量处理在预测和效率指标上优于 batch baseline;(2) change-aware 仪器化与更高的 LLM-judged 新颖性 (Cohen's d=3.46) 相关,但预测覆盖率较低,揭示了 quality-coverage 的权衡;(3) field 的轨迹稳定性与假设成功率相关 (r=-0.28, p=0.051),表明文献基于预测的边界条件;(4) knowledge 收敛信号的置信度几乎是矛盾信号的5倍,指向不同变化类型下的可预测性差异。这些发现表明,生成的假设性质不仅取决于处理的文献量,也取决于处理方式。进一步指出,评估框架必须考虑 quality-coverage 权衡,而非仅优化单个指标。

关键词

引用

@article{arxiv.2604.12243,
  title  = {Continuous Knowledge Metabolism: Generating Scientific Hypotheses from Evolving Literature},
  author = {Jinkai Tao and Yubo Wang and Xiaoyu Liu and Menglin Yang},
  journal= {arXiv preprint arXiv:2604.12243},
  year   = {2026}
}

备注

32 pages, 6 figures