中文

CrossTrace:用于假设生成的跨域 grounded 科学推理链数据集

计算与语言 2026-04-01 v1

摘要

科学假设生成是加速研究的关键瓶颈,而现有用于训练和评估假设生成模型的数据集仅限于单一学科且缺乏连接先验知识与新颖贡献的明确推理链。我引入 CrossTrace,一个包含 1,389 条 grounded 科学推理链的数据集,覆盖生物医学研究(518 条)、人工智能/机器学习(605 条)以及跨域工作(266 条)。每条推理链捕获从 established 知识经由中间逻辑步骤到 novel 假设的结构化推理链,每一步都以 source paper 文本为依据。我定义了 Input/Trace/Output 框架,扩展了 HypoGen 的 Bit-Flip-Spark 框架,加入步骤级验证、八大发现模式分类,以及跨学科覆盖。通过 QLoRA 在 CrossTrace 上对 Qwen2.5-7B-Instruct 进行微调,相较于未微调的基线实现显著提升:IAScore 从 0.828 提升至 0.968(GPT-4o 评判),从 0.716 提升至 0.888(Claude Opus 4.5),结构合规率从 0% 提升至 100%,spark 余弦相似度从 0.221 提升至 0.620。平衡的跨域训练(生物医学 + AI/ML + 计算机科学)优于单域训练,提供了科学推理模式在不同学科间传递的证据。对 150 条分层抽样记录的人类验证表明,步骤级依据准确率为 99.7%,虚构率为 0.0%。据我所知,CrossTrace 是首个大规模、跨域、带步骤级 grounded 推理链的数据集,用于假设生成,我的结果表明,这类推理链是有效训练信号,其益处至少在一定程度上具有跨域通用性。

关键词

引用

@article{arxiv.2603.28924,
  title  = {CrossTrace: A Cross-Domain Dataset of Grounded Scientific Reasoning Traces for Hypothesis Generation},
  author = {Andrew Bouras and OMS-II Research Fellow},
  journal= {arXiv preprint arXiv:2603.28924},
  year   = {2026}
}

备注

14 pages, 1 figure, 8 tables. Dataset and code available at https://github.com/andrewbouras/crosstrace