MInCo: 通过强化学习缓解注意力型视觉模型基强化学习中的信息冲突
机器学习
2025-07-04 v3
摘要
现有的基于观察重建的视觉模型基强化学习(MBRL)算法常因信息冲突而难以学习紧凑表征,导致策略鲁棒性差,尤其在存在任务无关视觉干扰时更甚。本文首先从信息论视角揭示当前视觉MBRL算法中的信息冲突源于视觉表征学习与潜在动力学建模。基于此发现,我们提出了一种新算法用于解决视觉MBRL中的信息冲突,命名为MInCo,通过利用负样本自由对比学习来缓解信息冲突,有助于学习不变表征和在噪声观察下保持鲁棒策略。为防止视觉表征学习主导,我们引入随时间变化的加权以偏向动力学建模。我们在多个带有动态背景干扰的机器人控制任务上评估了该方法。实验结果表明,MInCo能对抗背景噪声学习出不变表征,并持续优于当前的SOTA视觉MBRL方法。代码已公开于 https://github.com/ShiguangSun/minco。
引用
@article{arxiv.2504.04164,
title = {MInCo: Mitigating Information Conflicts in Distracted Visual Model-based Reinforcement Learning},
author = {Shiguang Sun and Hanbo Zhang and Zeyang Liu and Xinrui Yang and Lipeng Wan and Xingyu Chen and Xuguang Lan},
journal= {arXiv preprint arXiv:2504.04164},
year = {2025}
}