关于 In-Context 强化学习单调性改进的探索
机器学习
2025-09-30 v1 人工智能
摘要
In-Context强化学习(ICRL)是一种新兴范式,旨在通过利用过去经验作为上下文,使智能体能够快速适应新任务,而无需更新参数。近期方法在在线RL中训练单调策略改进数据,旨在持续提升测试时的性能。然而,我们的实验分析揭示,这些模型在测试阶段无法像训练数据中那样持续实现改进。理论上,我们识别了这一现象为情境歧义(Contextual Ambiguity),即模型自身的随机动作会生成与训练数据中次优策略类似的交互历史,从而引发动作选择的恶性循环。为解决情境歧义,我们引入Context Value作为训练阶段的信号,并提出Context Value引导的ICRL(CV-ICRL)。CV-ICRL将Context Value作为表示给定当前上下文可实现理想性能的显式信号。随着上下文的扩展,Context Value可能包含更多任务相关信息,因此理想性能应呈非递减趋势。我们证明了Context Value紧密界定了相对于理想单调改进策略的性能差距。我们进一步提出两种方法,用于在训练和测试阶段估计Context Value。在Dark Room和Minigrid测试平台上的实验表明,CV-ICRL有效缓解了性能退化,并在各种任务和环境中提升了整体ICRL能力。本论文的源代码和数据可在https://github.com/Bluixe/towards_monotonic_improvement 获取。
关键词
引用
@article{arxiv.2509.23209,
title = {Towards Monotonic Improvement in In-Context Reinforcement Learning},
author = {Wenhao Zhang and Shao Zhang and Xihuai Wang and Yang Li and Ying Wen},
journal= {arXiv preprint arXiv:2509.23209},
year = {2025}
}