解构强化微调设计选择:基于批量情境多臂老虎机学习的视角
机器学习
2026-02-02 v1 人工智能
摘要
强化微调领域正因优化设计选择而涌现出大量论文。尽管常宣称性能提升,但时而也出现不一致的结论,这使得进展显得模糊不清。反思这种幻象,我们仍缺乏对两个根本问题的原则性答案:1) 每种设计选择在何种作用?2) 哪些是关键的?本文旨在为此提供 clarity。潜在挑战在于设计选择相互缠结,使其对学习和泛化的贡献难以归因。为此,我们首先构建一个极简基线来解耦因素:每轮仅进行一次查询的 rollout,结果奖励作为训练信号,无任何 advantage 技巧,batch size 为 32。该基线连接到 batched contextual bandit learning,以促进实验分析。围绕该基线,我们设计实验管道,检验诸如 advantage、rollout 数量等因素的边际收益。在三个 base 模型和两个数据集上的实验,不仅揭示了关于各种设计选择对学习和泛化动力学的新理解,还识别出值得更多关注的关键因素。
关键词
引用
@article{arxiv.2601.22532,
title = {Demystifying Design Choices of Reinforcement Fine-tuning: A Batched Contextual Bandit Learning Perspective},
author = {Hong Xie and Xiao Hu and Tao Tan and Haoran Gu and Xin Li and Jianyu Han and Defu Lian and Enhong Chen},
journal= {arXiv preprint arXiv:2601.22532},
year = {2026}
}