中文

基于反思生成模型的测试时间扩展

机器学习 2025-07-10 v2 计算与语言

摘要

我们介绍了首个反思生成模型MetaStone-S1,通过新的反思生成形式实现了OpenAI o3-mini的性能。该新形式专注于高质量推理轨迹选择,包含两个创新点:1) 统一的策略和process奖励模型接口:我们共享背板网络,并针对推理轨迹预测和评分分别使用任务特定的头部,仅引入5300万额外参数用于轨迹评分。2) 消除对process级标注的依赖:我们提供一种自监督的process奖励模型,能够从结果奖励中直接学习高质量推理轨迹选择。凭借反思生成形式,MetaStone-S1天然适合测试时间扩展,我们提供了基于可控推理长度的三个推理 effort 模式(低、中、高)。实验表明,我们的MetaStone-S1仅凭320亿参数规模即可实现与OpenAI o3-mini系列相当的性能。为支持研究社区,我们已在https://github.com/MetaStone-AI/MetaStone-S1 上开源MetaStone-S1。

关键词

引用

@article{arxiv.2507.01951,
  title  = {Test-Time Scaling with Reflective Generative Model},
  author = {Zixiao Wang and Yuxin Wang and Xiaorui Wang and Mengting Xing and Jie Gao and Jianjun Xu and Guangcan Liu and Chenhui Jin and Zhuo Wang and Shengzhuo Zhang and Hongtao Xie},
  journal= {arXiv preprint arXiv:2507.01951},
  year   = {2025}
}