中文

从科学文献中生成洞见:GIANTS 框架

计算与语言 2026-04-14 v1 人工智能

摘要

科学突破常源于将先前想法综合成新贡献。虽然语言模型在科学发现方面显示出前景,但其执行此类以文献为基础的精准、综合性推断的能力尚未得到充分探索。我们提出洞见预测 (insight anticipation) 这一生成任务,即从母稿论文中预测下游论文的核心洞见。为评估此能力,我们构建 GiantsBench 数据集,包含 17k 个示例,覆盖八个科学领域;每个示例由一组母稿论文配以下游论文的核心洞见。我们使用 LM judge 对生成结果与真实洞见的相似度进行评分,显示这些相似度分数与专家人类评分呈相关性。最后,我们提出 GIANTS-4B,这是一个通过强化学习训练的 LM,旨在优化洞见预测,使用相似度分数作为代理奖励。尽管其规模较小且为开源架构,GIANTS-4B 仍优于专有基线,实现跨领域泛化,相较于 gemini-3-pro 在相似度分数上提升 34%。人类评估进一步表明,GIANTS-4B 生成的洞见在概念清晰度上优于基线模型。此外,SciJudge-30B 这一第三方模型预测,GIANTS-4B 生成的洞见更可能导致更高引用次数,在两两比较中优先于基线模型的比例达 68%。我们发布代码、数据集和模型,以支持未来在自动化科学发现领域的研究。

关键词

引用

@article{arxiv.2604.09793,
  title  = {GIANTS: Generative Insight Anticipation from Scientific Literature},
  author = {Joy He-Yueya and Anikait Singh and Ge Gao and Michael Y. Li and Sherry Yang and Chelsea Finn and Emma Brunskill and Noah D. Goodman},
  journal= {arXiv preprint arXiv:2604.09793},
  year   = {2026}
}