中文

Re-FORC:自适应奖励预测用于高效链式思考推理

人工智能 2025-11-05 v1 机器学习

摘要

我们提出Re-FORC,一种自适应奖励预测方法,给定上下文后,可预测随未来思考token数量变化的预期未来奖励。Re-FORC在推理模型上训练轻量级适配器,在更长的推理和更大模型上实现更好的预测。Re-FORC实现了:1)终止无前景推理链,在保持准确性的同时降低计算量26%;2)优化模型和思考长度选择,在相同计算量下准确率提高4%,在相同准确率下计算量降低55%;3)自适应测试时扩展,在高计算场景下提升准确率11%,在低计算场景下提升7%。Re-FORC允许通过成本/token阈值实现动态推理,并在估算计算时间前提下控制长度。

关键词

引用

@article{arxiv.2511.02130,
  title  = {Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning},
  author = {Renos Zabounidis and Aditya Golatkar and Michael Kleinman and Alessandro Achille and Wei Xia and Stefano Soatto},
  journal= {arXiv preprint arXiv:2511.02130},
  year   = {2025}
}

备注

Accepted at Efficient Reasoning Workshop at NeurIPS 2025