当贪婪获胜:元Bandit LLM训练中的涌现利用偏差
机器学习
2025-09-30 v1 人工智能
计算与语言
摘要
尽管大型语言模型(LLMs)有望成为自主智能体,但它们在序贯决策中往往进行次优探索。近期工作试图通过监督微调(SFT)或强化学习(RL)来增强这一能力,以改善在经典多臂Bandit任务上的遗憾值。然而,这些学习方法如何塑造探索策略及其泛化能力如何,仍不清楚。我们通过在专家轨迹上使用SFT以及使用一系列定制奖励信号(包括用于降低方差的策略性遗憾整形奖励,以及实现预言机模仿的算法奖励)对LLMs进行RL训练,研究了这两种范式。所得智能体优于预训练模型,并取得了与置信区间上界(UCB)和Thompson Sampling相当的性能,且对6倍更长的时间跨度及跨Bandit族具有稳健的泛化能力。行为分析表明,这些增益往往源于更复杂但也更贪婪的利用:与预训练模型相比,RL/SFT智能体更容易出现早期灾难性失败,过早放弃探索。此外,被训练去模仿UCB的智能体通过采用更具利用性的变体,学会了超越其教师。我们的发现阐明了何时优先选用每种训练范式,并提倡定制的奖励设计以及超越平均遗憾值的评估,以促进稳健的探索行为。
引用
@article{arxiv.2509.24923,
title = {When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training},
author = {Sanxing Chen and Xiaoyin Chen and Yukun Huang and Roy Xie and Bhuwan Dhingra},
journal= {arXiv preprint arXiv:2509.24923},
year = {2025}
}