中文

将拼图块放在关键位置:强化学习问题增强框架

机器学习 2026-05-04 v2

摘要

强化学习已成为增强大型语言模型推理能力的强大方法,但面临根本性困境:在简单问题上训练会导致过拟合和pass@k下降,而在困难问题上训练则常导致稀疏奖励。最近的question增强方法通过添加部分解决方案作为提示来解决此问题。然而,统一的提示提供可能引入冗余信息,同时遗漏关键推理瓶颈,过多的提示还会减少推理多样性,导致pass@k下降。我们提出PieceHint(拼图提示),一种在训练期间战略性地识别和提供关键推理步骤的提示注入框架。通过对不同推理步骤的重要性评分,基于问题难度选择性分配提示,并逐步撤回脚手架,PieceHint使模型能够从引导式学习过渡到独立推理。在六个数学推理基准实验中,我们的15亿参数模型在保持所有k值下pass@k多样性的同时,实现了与32亿参数基线相当的平均性能。

关键词

引用

@article{arxiv.2604.15830,
  title  = {Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning},
  author = {Yangyi Fang and Jiaye Lin and Xiaoliang Fu and Cong Qin and Haolin Shi},
  journal= {arXiv preprint arXiv:2604.15830},
  year   = {2026}
}