检测容易,适应困难:分布偏移下基于视觉模型的强化学习的局部专家增长
机器学习
2026-05-01 v1
摘要
基于视觉模型的强化学习(MBRL)智能体在训练分布上可以表现良好,但一旦测试环境发生偏移,往往会失效。在视觉 MBRL 中,识别偏移已经发生通常是较容易的部分;较难的部分是将这种识别转化为有用的动作级校正。我们研究了几种应对偏移的方法,包括规划惩罚、直接微调、全局残差校正和粗粒度门控。在我们的实验中,这些方法要么不能改善闭环控制,要么损害了分布内(ID)性能。基于这些负面结果,我们提出了 JEPA-索引的局部专家增长。该方法使用冻结的 JEPA 表示仅用于问题索引,而集群特定的残差专家在原始控制器之上添加局部动作校正。基线控制器本身不被修改。使用配对自举评估,我们发现原始的朴素偏好变体在更严格的测试下并不稳定。相比之下,更难配对变体在所有四个评估的偏移条件下都产生了统计上显著的分布外(OOD)改进,同时保持了 ID 性能。当再次遇到相同的偏移时,学习到的专家仍然有用,这支持了将适应视为增量知识增长而非重复完全重新训练的观点。我们进一步表明,可以使用简单的密度模型实现自动 ID 拒绝,而对 OOD 子族的细粒度区分则受到表示的限制。总体而言,结果表明,对于分布偏移下的视觉 MBRL,主要挑战不仅仅是注意到环境已经改变,而是在识别到变化后应用正确的局部动作校正。
引用
@article{arxiv.2604.27411,
title = {Detecting is Easy, Adapting is Hard: Local Expert Growth for Visual Model-Based Reinforcement Learning under Distribution Shift},
author = {Haiyang Zhao},
journal= {arXiv preprint arXiv:2604.27411},
year = {2026}
}