中文

科学火花:使用结构化论文数据生成假设

计算与语言 2025-04-18 v1

摘要

生成新颖且富有创造性的科学假设是实现人工通用智能(AGI)的基石。大型语言与推理模型有望有助于系统性地创建、选择和验证科学信息化假设。然而,当前基础模型常常难以产生既新颖又可行的科学想法。其中一个原因是缺乏专门用于刻画科学假设生成(Scientific Hypothesis Generation, SHG)为自然语言生成(Natural Language Generation, NLG)任务的数据集。本文介绍了 HypoGen,即首个约含 5500 条结构化问题-假设对的数据集,从顶级计算机科学会议中抽取,采用 Bit-Flip-Spark 模式结构化:Bit 为常规假设,Spark 为关键洞见或概念性飞跃,Flip 为随之而来的反向提议。HypoGen 独特地集成了显式的链式推理组件,反映了从 Bit 到 Flip 的思维过程。我们展示了将假设生成表述为条件语言建模的方法,通过在 Bit-Flip-Spark 与链式推理(Inference 时仅提供 Bit)上进行微调,可提升生成假设的整体质量。我们的评估采用自动化指标与大语言模型判断排名进行整体质量评估。我们表明,通过在 HypoGen 数据集上微调可提升生成假设的新颖性、可行性及整体质量。HypoGen 数据集已公开于 huggingface.co/datasets/UniverseTBD/hypogen-dr1。

关键词

引用

@article{arxiv.2504.12976,
  title  = {Sparks of Science: Hypothesis Generation Using Structured Paper Data},
  author = {Charles O'Neill and Tirthankar Ghosal and Roberta Răileanu and Mike Walmsley and Thang Bui and Kevin Schawinski and Ioana Ciucă},
  journal= {arXiv preprint arXiv:2504.12976},
  year   = {2025}
}

备注

9 pages, 2 figures. Comments welcome