中文

超越数值奖励:基于 LLM 代理的情境内对战型多臂老虎机

机器学习 2025-06-10 v4 人工智能 计算与语言

摘要

情境内强化学习(In-Context Reinforcement Learning, ICRL)是解决基础模型时代强化学习(Reinforcement Learning, RL)问题的前沿范式。尽管 ICRL 能力已通过特定任务训练在变压器中得到证明,但大型语言模型(Large Language Models, LLMs)在即插即用情况下的潜力仍鲜有探索。本文 investigates whether LLMs can generalize cross-domain to perform ICRL under the problem of Dueling Bandits(DB),即无状态的偏好型强化学习设置。我们发现,表现最佳的 LLMs 在零样本条件下展现出相当程度的相对决策能力,这导致其在所有 DB 环境实例中均实现较低的短期弱 regret,通过快速纳入最佳 arm。然而,LLMs 与经典 DB 算法在强 regret 方面仍存在最优性差距。LLMs 在尝试收敛和持续利用时表现不佳,即便明确提示也如此,且对提示变体敏感。为弥合这一差距,我们提出了 LLM 增强型情境对战(LLM with Enhanced Algorithmic Dueling, LEAD)框架,将即插即用的 DB 算法支持与 LLM 代理通过细粒度自适应交互集成。我们表明 LEAD 继承了经典 DB 算法在弱和强 regret 上的理论保证。我们验证了其在噪声和对抗性提示下的有效性和鲁棒性。这种代理框架的设计为提升通用 LLM 在情境决策任务中的可信度指明了方向。

关键词

引用

@article{arxiv.2407.01887,
  title  = {Beyond Numeric Rewards: In-Context Dueling Bandits with LLM Agents},
  author = {Fanzeng Xia and Hao Liu and Yisong Yue and Tongxin Li},
  journal= {arXiv preprint arXiv:2407.01887},
  year   = {2025}
}

备注

ACL 2025 Findings