中文

CHIMERA:用于通用 LLM 推理的紧凑合成数据

计算与语言 2026-03-03 v1 人工智能

摘要

大型语言模型 (LLM) 最近在推理能力方面表现突出,这在很大程度上归功于基于监督微调 (SFT) 和强化学习 (RL) 的后训练在高质量推理数据上的效果。然而,在开放且可扩展的设置中复现和扩展这些能力受到三个根本数据挑战的阻碍:(1) 冷启动问题,源于缺乏包含详细、长链式思维 (CoT) 轨迹的种子数据集以初始化推理策略;(2) 领域覆盖有限,因为大多数现有开源推理数据集集中在数学领域,覆盖的更广泛的科学学科有限;(3) 标注瓶颈, frontier-level 推理任务的困难程度使得可靠的人类标注在成本和可行性方面变得不可行。为此,我们引入 CHIMERA,一个用于通用跨域推理的紧凑合成推理数据集,包含 9K 个样本。CHIMERA 拥有三个关键特性:(1) 它提供由最新推理模型综合的丰富、长CoT 推理轨迹;(2) 其覆盖面广泛且结构化,涵盖 8 个主要科学学科以及由模型生成的层次化分类组织的 1K 多个细粒度主题;(3) 它采用完全自动化、可扩展的评估管道,使用强大的推理模型交叉验证问题的有效性和答案的正确性。我们使用 CHIMERA 对 4B Qwen3 模型进行后训练。尽管数据集规模适中,该模型在一系列具有挑战性的推理基准测试上表现出强劲的性能,包括 GPQA-Diamond、AIME 24/25/26、HMMT 25 和 Humanity's Last Exam,接近或匹配了诸如 DeepSeek-R1 和 Qwen3-235B 等大规模模型的推理性能。

关键词

引用

@article{arxiv.2603.00889,
  title  = {CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning},
  author = {Xinyu Zhu and Yihao Feng and Yanchao Sun and Xianzhi Du and Pingzhi Li and Olli Saarikivi and Yun Zhu and Yu Meng},
  journal= {arXiv preprint arXiv:2603.00889},
  year   = {2026}
}