我们何时应偏好 State-to-Visual DAgger 而非视觉强化学习?
计算机视觉与模式识别
2024-12-19 v1 人工智能
机器学习
机器人学
摘要
从高维视觉输入(如像素和点云)中学习策略在各类应用中至关重要。视觉强化学习是一种直接从视觉观测中训练策略的有前景的方法,尽管它在样本效率和计算成本方面面临挑战。本研究在多种任务中对 State-to-Visual DAgger 和 Visual RL 进行了经验性比较,前者是一个两阶段框架,首先训练状态策略,随后采用在线模仿学习来学习视觉策略。我们在三个基准的 16 个任务上评估了这两种方法,重点关注它们的渐近性能、样本效率和计算成本。令人惊讶的是,我们的研究结果表明,State-to-Visual DAgger 并未普遍优于 Visual RL,而是在具有挑战性的任务中表现出显著优势,提供了更一致的性能。相比之下,尽管它通常能减少训练所需的总挂钟时间,但其在样本效率方面的益处并不明显。基于我们的发现,我们为从业者提供了建议,并希望我们的结果能为视觉策略学习的未来研究提供有价值的视角。
引用
@article{arxiv.2412.13662,
title = {When Should We Prefer State-to-Visual DAgger Over Visual Reinforcement Learning?},
author = {Tongzhou Mu and Zhaoyang Li and Stanisław Wiktor Strzelecki and Xiu Yuan and Yunchao Yao and Litian Liang and Hao Su},
journal= {arXiv preprint arXiv:2412.13662},
year = {2024}
}
备注
Accepted by The 39th Annual AAAI Conference on Artificial Intelligence (AAAI 2025)