重新思考 LLM 强化微调:多臂老虎机学习视角
机器学习
2026-01-22 v1 人工智能
摘要
针对 LLM 强化微调,已提出许多启发式方法,但时不时地出现不一致的论点,使该领域变得晦涩。反思这一局面后,仍有两个根本问题缺乏清晰的理解:1) 每种优化选择的作用是什么?2) 哪些选择是瓶颈?本文旨在阐明这些问题,同时要克服在微调过程中存在的多个纠缠的混杂因素。为此,我们提出了自下而上的实验管道。底层由极简配置组成:单一训练数据、每轮一个 rollout 以及奖励直接作为学习信号,无需优势函数设计。这种极简配置可与离散动作空间极大的多臂老虎机学习相联系,为证实实验发现提供理论依据。实验管道的上层逐层扩展极简配置,检验每种设计选择的作用。在三个 LLM 和两个推理数据集上的实验结果不仅揭示了对设计选择的新理解,还为该领域的发展提供了关键见解。
引用
@article{arxiv.2601.14599,
title = {Rethinking Reinforcement fine-tuning of LLMs: A Multi-armed Bandit Learning Perspective},
author = {Xiao Hu and Hong Xie and Tao Tan and Defu Lian and Jianyu Han},
journal= {arXiv preprint arXiv:2601.14599},
year = {2026}
}