引导任务空间以实现自我改进
机器学习
2026-02-24 v3
摘要
许多任务领域的进步源于对先前求解尝试的反复修正。训练能够在推理时在此类序列中可靠地自我改进的智能体是强化学习(RL)的天然目标,然而朴素的方法假设固定的最大迭代深度,这既昂贵又具有任意性。我们提出了探索性迭代,这是一族自课程RL方法,直接利用自我改进任务的递归结构,在推理时训练LLM执行多步自我改进,同时仅在信息量最大的单步迭代上进行训练。ExIt通过选择性地对片段中遇到的信息量最大的中间、部分历史进行采样以继续迭代,从而扩展任务空间,并将这些起始点视为新的自迭代任务实例来训练自我改进策略。ExIt还可以与显式探索机制结合,以维持更大的任务多样性。在涵盖竞赛数学、多轮工具使用和机器学习工程的多个领域中,我们证明了ExIt策略从单个或多个任务实例开始,能够产生在留出任务实例上表现出强大推理时自我改进的策略,并且在超出训练期间遇到的平均迭代深度的步数预算下,具有向更高性能迭代的能力。
引用
@article{arxiv.2509.04575,
title = {Bootstrapping Task Spaces for Self-Improvement},
author = {Minqi Jiang and Andrei Lupu and Yoram Bachrach},
journal= {arXiv preprint arXiv:2509.04575},
year = {2026}
}
备注
TMLR, February 2026