基于 Segment Anything Model 的可泛化视觉强化学习
机器学习
2023-12-29 v1 计算机视觉与模式识别
机器人学
摘要
学习能够泛化到未见环境的策略是视觉强化学习(RL)中的一个基本挑战。虽然大多数当前方法专注于通过辅助监督、预训练或数据增强来获取鲁棒的视觉表示,但现代视觉基础模型的潜力尚未得到充分利用。在本工作中,我们引入了用于可泛化视觉 RL 的 Segment Anything Model(SAM-G),这是一种新颖的框架,利用 Segment Anything Model (SAM) 的可提示分割能力来增强视觉 RL 智能体的泛化能力。我们利用来自 DINOv2 和 SAM 的图像特征寻找对应关系作为 SAM 的点提示,随后 SAM 直接为智能体生成高质量的掩码图像。在 8 个 DMControl 任务和 3 个 Adroit 任务上的评估表明,SAM-G 在不改变 RL 智能体架构而仅改变其观测值的情况下,显著提高了视觉泛化能力。值得注意的是,与最先进的方法相比,SAM-G 在 DMControl 和 Adroit 的挑战性视频困难设置上分别实现了 44% 和 29% 的相对提升。视频和代码:https://yanjieze.com/SAM-G/
引用
@article{arxiv.2312.17116,
title = {Generalizable Visual Reinforcement Learning with Segment Anything Model},
author = {Ziyu Wang and Yanjie Ze and Yifei Sun and Zhecheng Yuan and Huazhe Xu},
journal= {arXiv preprint arXiv:2312.17116},
year = {2023}
}
备注
Project page and code: https://yanjieze.com/SAM-G/