反思性上下文学习:研究上下文空间的优化原语
机器学习
2026-04-06 v1 人工智能
摘要
通用智能体必须以跨任务和跨环境泛化的方式从经验中学习。学习的基本问题,包括信用分配、过拟合、遗忘、局部最优和高方差学习信号,无论学习对象位于参数空间还是上下文空间中,都依然存在。虽然这些挑战在经典的机器学习优化中已被充分理解,但它们在上下文空间中仍未被充分探索,导致当前方法碎片化且缺乏系统性。我们提出了反思性上下文学习(RCL),一个统一的框架,智能体通过反复交互、对行为和失败模式的反思以及上下文的迭代更新来学习。在 RCL 中,反思将轨迹和当前上下文转换为类似于梯度的方向性更新信号,而变异将该信号应用于改进上下文空间中的未来行为。我们将最近的上下文优化方法重新表述为该共享学习问题的实例,并通过经典优化原语系统地扩展它们,包括批处理、改进的信用分配信号、辅助损失、失败回放和用于方差减少的分组 rollout。在 AppWorld、BrowseComp+ 和 RewardBench2 上,这些原语在强基线之上取得了改进,其相对重要性在不同任务范式中有所变化。我们进一步分析了初始化的鲁棒性、批量大小、采样和课程策略的影响、优化器状态变体,以及将更强或更弱的模型分配到不同优化组件的影响。我们的结果表明,通过上下文更新进行学习不应被视为一组孤立的算法,而应被视为一个优化问题,其机制可以通过可迁移的原则进行系统研究和改进。
引用
@article{arxiv.2604.03189,
title = {Reflective Context Learning: Studying the Optimization Primitives of Context Space},
author = {Nikita Vassilyev and William Berrios and Ruowang Zhang and Bo Han and Douwe Kiela and Shikib Mehri},
journal= {arXiv preprint arXiv:2604.03189},
year = {2026}
}
备注
Under review at COLM. Github: https://github.com/nvassilyev/RCL