增强移动机器人基于视觉的策略:运用全视野和跨模态知识蒸馏
机器人学
2026-03-24 v1
摘要
基于视觉的策略在机器人操作中广泛应用于操控和 locomotion 等任务。然而,在轻量级移动机器人上面临场景可迁移性受限、 onboard 计算资源受限以及传感器硬件成本等三大挑战。为此,我们提出了一种知识蒸馏方法,将来自信息丰富、外观不变的全视野深度策略的知识传递给轻量级单目策略。关键思想是训练学生不仅要模仿专家动作,还要与全视野深度教师的潜在嵌入对齐。实验表明,全视野和深度输入改善了场景迁移和导航性能,且所提出的蒸馏方法较仅仅模仿动作的策略显著提升了单视图单目策略的性能。实际场景实验进一步验证了该方法的有效性和实用性。代码将公开发布。
引用
@article{arxiv.2603.20679,
title = {Enhancing Vision-Based Policies with Omni-View and Cross-Modality Knowledge Distillation for Mobile Robots},
author = {Kai Li and Shiyu Zhao},
journal= {arXiv preprint arXiv:2603.20679},
year = {2026}
}