DeGuV:面向操作任务泛化与可解释性的深度引导视觉强化学习
机器人学
2025-09-08 v1 人工智能
摘要
强化学习(RL)智能体能够从视觉输入中学习解决复杂任务,但将这些学到的技能泛化到新环境仍然是 RL 应用(尤其是机器人领域)中的一大挑战。虽然数据增强可以改善泛化能力,但它往往会牺牲样本效率和训练稳定性。本文提出了 DeGuV,一个同时增强泛化能力和样本效率的 RL 框架。具体而言,我们利用一个可学习的掩码网络,该网络根据深度输入生成掩码,仅保留关键的视觉信息,同时丢弃不相关的像素。通过这种方式,我们确保 RL 智能体专注于基本特征,从而提升在数据增强下的鲁棒性。此外,我们结合了对比学习,并在增强条件下稳定 Q 值估计,以进一步提高样本效率和训练稳定性。我们在 RL-ViGen 基准上使用 Franka Emika 机器人对所提方法进行了评估,并展示了其在零样本仿真到现实迁移中的有效性。结果表明,DeGuV 在泛化能力和样本效率方面均优于现有最先进方法,同时通过高亮视觉输入中最相关的区域,还提升了可解释性。
引用
@article{arxiv.2509.04970,
title = {DeGuV: Depth-Guided Visual Reinforcement Learning for Generalization and Interpretability in Manipulation},
author = {Tien Pham and Xinyun Chi and Khang Nguyen and Manfred Huber and Angelo Cangelosi},
journal= {arXiv preprint arXiv:2509.04970},
year = {2025}
}