中文

推理监督的哪些属性与改进的下游模型质量相关?

人工智能 2026-05-14 v1

摘要

验证推理模型的训练数据通常需要昂贵的试错调优循环。在本工作中,我们调查推理数据集的实用性是否可以在训练前通过内在数据度量标准可靠地预测。我们提出了一套量化措施,并通过在波兰推理数据集的语义不同变体上对 8B 和 11B 模型进行微调来评估其预测能力。我们的分析显示,这些内在度量标准与下游模型性能之间显示出强烈且显著的相关性。关键的是,我们发现实用性的预测器随模型规模而异:较小的模型依赖以对齐为导向的度量以确保精确度,而较大的模型则受益于高冗余度,利用冗长的痕迹来解决复杂任务。这些发现建立了一个基于规模的框架,用于验证推理数据,使实践者能够在无需进行详尽实证测试的情况下选择有效的训练集。

关键词

引用

@article{arxiv.2605.13290,
  title  = {What properties of reasoning supervision are associated with improved downstream model quality?},
  author = {Mikołaj Langner and Dzmitry Pihulski and Jan Eliasz and Michał Rajkowski and Przemysław Kazienko and Maciej Piasecki and Jan Kocoń and Teddy Ferdinan},
  journal= {arXiv preprint arXiv:2605.13290},
  year   = {2026}
}

备注

To appear in the Proceedings of the International Conference on Computational Science (ICCS) 2026