HS-STaR:基于难度估计和预算重新分配的自学推理者的层次化抽样
人工智能
2025-09-30 v2 计算与语言
机器学习
摘要
自学推理者(STaRs)通过利用自生成响应进行自我训练来提升大型语言模型(LLM)的数学推理能力。最近的研究 incorpora reward models 以引导响应选择或解码,以获得更高质量的数据。然而,这些方法通常在所有问题上均匀分配抽样预算,忽略了不同难度水平问题的差异化效用。本文进行了实证研究,发现处于 LLM 推理能力边界附近的问题,其学习效用显著高于既简单又过于困难的问题。为识别并利用此类问题,我们提出了 HS-STaR,即面向自学推理者的层次化抽样框架。给定固定的抽样预算后,HS-STaR 首先采用基于奖励引导的难度估计策略进行轻量级预抽样,以高效识别边界级问题。随后,在重新抽样阶段动态重新分配剩余预算至这些高效益问题,以最大化有价值训练数据的生成。广泛的实验在多个推理基准和不同 backbone LLM 上表明,HS-STaR 在不需额外抽样预算的情况下显著优于其他基线方法。
引用
@article{arxiv.2505.19866,
title = {HS-STaR: Hierarchical Sampling for Self-Taught Reasoners via Difficulty Estimation and Budget Reallocation},
author = {Feng Xiong and Hongling Xu and Yifei Wang and Runxi Cheng and Yong Wang and Xiangxiang Chu},
journal= {arXiv preprint arXiv:2505.19866},
year = {2025}
}