通过分类 LED 状态实现无姿态标签的视觉位姿估计自监督学习
机器人学
2025-09-15 v1
摘要
我们提出了一种用于地面机器人单目 RGB 相对位姿估计的模型,该模型从零开始训练,无需姿态标签,也无需关于机器人形状或外观的先验知识。在训练时,我们假设: 机器人装有多个 LED,其状态在各帧间是独立且已知的; 已知每个 LED 的近似视角方向; 具备一张已知目标距离的标定图像,以解决单目深度估计的歧义性。训练数据由一对随机移动的机器人收集,无需外部基础设施或人工监督。我们的模型基于从图像中预测机器人上每个 LED 状态的任务进行训练。在此过程中,它学会了预测机器人在图像中的位置、距离及其相对方位角。在推理时,LED 的状态是未知的,可以是任意的,且不影响位姿估计性能。定量实验表明,我们的方法:与需要姿态标签监督或机器人 CAD 模型的现有方法(SoA)具有竞争力;能泛化到不同领域;并能处理多机器人位姿估计。
引用
@article{arxiv.2509.10405,
title = {Self-supervised Learning Of Visual Pose Estimation Without Pose Labels By Classifying LED States},
author = {Nicholas Carlotti and Mirko Nava and Alessandro Giusti},
journal= {arXiv preprint arXiv:2509.10405},
year = {2025}
}
备注
accepted at CoRL 2025