VIBR:学习视角不变值函数以实现鲁棒视觉控制
机器学习
2024-01-19 v1 计算机视觉与模式识别
系统与控制
系统与控制
摘要
近年来,基于图像的端到端强化学习取得了显著进展。基于数据的方法利用数据增强和域随机化,而表示学习方法使用辅助损失来学习任务相关特征。然而,强化学习在充满干扰和伪噪声的视觉多样环境中仍举步维艰。在这项工作中,我们从核心上解决鲁棒视觉控制问题,提出VIBR(视角不变Bellman残差),一种结合多视角训练和不变预测以缩小基于RL的视觉运动控制的分布外(OOD)泛化差距的方法。我们的无模型方法在不需要额外表示学习目标且附加计算成本有限的情况下改进了基线性能。我们表明VIBR在具有高视觉扰动的复杂视觉运动控制环境中优于现有方法。我们的方法在Distracting Control Suite基准上取得了最先进的结果,这是一个当前方法尚未解决的具有挑战性的基准,我们在其上评估了对多种视觉扰动器的鲁棒性,以及OOD泛化和外推能力。
引用
@article{arxiv.2306.08537,
title = {VIBR: Learning View-Invariant Value Functions for Robust Visual Control},
author = {Tom Dupuis and Jaonary Rabarisoa and Quoc-Cuong Pham and David Filliat},
journal= {arXiv preprint arXiv:2306.08537},
year = {2024}
}