结合视点轨迹正则化的位姿感知自监督学习
计算机视觉与模式识别
2024-08-08 v2 机器学习
摘要
从无标签图像中学习视觉特征在语义分类中已被证明是成功的,通常通过将同一对象的不同 映射到同一特征来实现识别不变性。然而,视觉识别不仅涉及识别对象是 ,还涉及理解它是 呈现的。例如,从侧面还是正面看到一辆汽车,对于决定是留在原地还是跳开至关重要。虽然用于下游视点推理的无监督特征学习很重要,但这一领域仍处于探索不足的阶段,部分原因是缺乏标准化的评估方法和基准。我们引入了一个新的数据集,该数据集由从视点轨迹获得的相邻图像三元组组成,没有任何语义或位姿标签。我们在相同的视觉特征上对语义分类和位姿估计精度进行了基准测试。此外,我们提出了一种视点轨迹正则化损失,用于从无标签图像三元组中学习特征。我们的实验表明,这种方法有助于开发出编码对象身份并按位姿组织对象的视觉表示,在保持语义分类精度的同时,实现了涌现的全局位姿感知并对新物体具有更好的泛化能力。我们的数据集和代码可在 http://pwang.pw/trajSSL/ 获取。
引用
@article{arxiv.2403.14973,
title = {Pose-Aware Self-Supervised Learning with Viewpoint Trajectory Regularization},
author = {Jiayun Wang and Yubei Chen and Stella X. Yu},
journal= {arXiv preprint arXiv:2403.14973},
year = {2024}
}
备注
Accepted by ECCV 2024