中文

ViT-VS:预训练视觉 Transformer 特征在通用视觉伺服中的适用性研究

机器人学 2025-07-14 v1 计算机视觉与模式识别

摘要

视觉伺服使机器人能够精确地将其末端执行器相对于目标对象进行定位。虽然经典方法依赖手工特征,因而无需任务特定训练即可普遍适用,但常在遮挡和环境变化方面表现不足;而学习方法虽能提升鲁棒性,但通常需要大量训练。我们提出了一种视觉伺服方法,利用预训练视觉 Transformer 进行语义特征提取,兼具两者优势且能够在所提供样本之外进行泛化。我们的方法在无扰动情景下实现完全收敛,并在扰动情景下相较于经典基于图像的视觉伺服提升了最高可达 31.2% 的相对性能。即使是学习方法的收敛速度也在无需任务或对象特定训练的情况下得到匹配。实际环境评估表明,在末端执行器定位、工业箱体操作以及抓取未知目标方面,均能实现稳健的性能。我们的代码和仿真环境已公开:https://alessandroscherl.github.io/ViT-VS/。

关键词

引用

@article{arxiv.2503.04545,
  title  = {ViT-VS: On the Applicability of Pretrained Vision Transformer Features for Generalizable Visual Servoing},
  author = {Alessandro Scherl and Stefan Thalhammer and Bernhard Neuberger and Wilfried Wöber and José García-Rodríguez},
  journal= {arXiv preprint arXiv:2503.04545},
  year   = {2025}
}