幻象还是方法?模型-任务对齐如何引发RL结论的差异
机器学习
2025-09-03 v2 计算与语言
摘要
近期将强化学习 (RL) 应用于大型语言模型 (LLM) 的进展取得显著成果。特别是,一系列惊人且常常反直觉的现象已被报道,显示出在传统RL环境中不常见的模式。例如,据称单个训练示例即可匹配使用整个数据集所达到的性能;奖励信号无需非常精确;仅使用负样本即可匹配甚至超越基于奖励的高级方法。然而,这些观察成立的精确条件——以及关键的是它们何时会失败——仍然不清晰。本文识别了一个关键因素,用以区分RL观察结果:预训练模型是否已 exhibits 强烈的模型-任务对齐,测量方式为评估任务上的 pass@k准确率。通过对一系列反直觉主张进行系统且全面的检验,并以严格的实验验证支撑不同模型架构和任务域,我们的发现表明,标准RL训练在各种设置下始终稳健,而许多反直觉结果仅在模型和任务已 exhibits 强强模型-任务对齐时才会出现。相比之下,这些技术在更具挑战性的情境中难以驱动显著学习,而标准RL方法仍然有效。
引用
@article{arxiv.2508.21188,
title = {Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions},
author = {Haoze Wu and Cheng Wang and Wenshuo Zhao and Junxian He},
journal= {arXiv preprint arXiv:2508.21188},
year = {2025}
}