通过控制感知增强实现可泛化视觉运动策略的高效训练
机器人学
2025-03-24 v2 计算机视觉与模式识别
摘要
提升泛化能力是具身人工智能中的一项关键挑战,因为获取跨多样化场景的大规模数据集成本高昂。传统的弱增强方法,如裁剪和翻转,不足以提升模型在新环境中的性能。现有的数据增强方法常常破坏图像中与任务相关的信息,可能导致性能下降。为克服这些挑战,我们提出了 EAGLE,一个用于可泛化视觉运动策略的高效训练框架,它通过以下方式改进现有方法:(1) 通过仅对由自监督控制感知掩码识别出的控制相关区域应用增强,来增强泛化能力;(2) 通过将知识从专家策略蒸馏到视觉运动学生策略,提升训练稳定性和效率,该学生策略随后被部署到未见环境中,无需进一步微调。在三个领域上的综合实验,包括 DMControl 泛化基准测试、增强的机器人操作干扰基准测试以及一个长序列抽屉打开任务,验证了我们方法的有效性。
引用
@article{arxiv.2401.09258,
title = {Efficient Training of Generalizable Visuomotor Policies via Control-Aware Augmentation},
author = {Yinuo Zhao and Kun Wu and Tianjiao Yi and Zhiyuan Xu and Xiaozhu Ju and Zhengping Che and Chi Harold Liu and Jian Tang},
journal= {arXiv preprint arXiv:2401.09258},
year = {2025}
}