通过蒸馏与RGB-D Transformer 实现稠密视觉嵌入的高效预测
计算机视觉与模式识别
2026-01-05 v1 机器人学
摘要
在家庭环境中,机器人需要全面理解其周围环境,以有效且直观地与未接受训练的人类交互。本文提出了DVEFormer——一种基于RGB-D Transformer的高效方法,通过知识蒸馏预测稠密文本对齐视觉嵌入(DVE)。该方法不直接进行带有固定预定义类别的经典语义分割,而是使用来自Alpha-CLIP的教师嵌入指导我们的高效学生模型DVEFormer学习像素级的细粒度嵌入。尽管这种方法仍然支持经典语义分割(例如通过线性探测),但进一步支持灵活的文本查询和其他应用,如创建综合性的3D地图。在常见室内数据集上的评估表明,我们的方法在保持竞争性能的同时满足实时要求,在NVIDIA Jetson AGX Orin上,完整模型达到26.3 FPS,小型变体达到77.0 FPS。此外,我们展示的定性结果突显了在实际应用中有效性及其可能用例。总体而言,我们的方法可作为传统分割方法的即插即用替换方案,同时实现灵活的自然语言查询和在移动机器人3D映射管道中的无缝集成。
引用
@article{arxiv.2601.00359,
title = {Efficient Prediction of Dense Visual Embeddings via Distillation and RGB-D Transformers},
author = {Söhnke Benedikt Fischedick and Daniel Seichter and Benedict Stephan and Robin Schmidt and Horst-Michael Gross},
journal= {arXiv preprint arXiv:2601.00359},
year = {2026}
}
备注
Published in Proc. IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)