用于学习状态不变对象表示的数据集和框架
计算机视觉与模式识别
2025-02-28 v2 信息检索
机器学习
摘要
我们在用于识别和检索的对象表示学习中,除了更常用的其他不变性之外,增加了一种不变性——状态不变性。所谓状态不变性,是指对对象结构形式的变化具有鲁棒性,例如雨伞折叠时,或衣物扔在地板上时。在这项工作中,我们提出了一个新的数据集ObjectsWithStateChange,它捕捉了从任意视角记录的物体图像中的状态和姿态变化。我们相信,这个数据集将促进能够发生状态变化的3D对象的细粒度对象识别和检索研究。这类研究的目标是训练能够学习判别性对象嵌入的模型,这些嵌入在状态变化下保持不变,同时也在视点、姿态、光照等变化引起的变换下保持不变。这方面的一个主要挑战是,不同对象(在同一类别内和跨类别)在各种状态变化下的实例可能共享相似的视觉特征,因此在学习到的嵌入空间中可能彼此接近,这将使区分它们更加困难。为了解决这个问题,我们提出了一种课程学习策略,在训练阶段逐步选择学习到的嵌入空间中对象间距离较小的对象对。这种方法逐渐采样更难区分的视觉相似对象示例,包括类别内和跨类别。与课程学习作用相关的消融实验表明,在我们的新数据集以及其他三个具有挑战性的多视图数据集(如ModelNet40、ObjectPI和FG3D)上,对象识别准确率提高了7.9%,检索mAP提高了9.2%,超过了现有技术水平。
引用
@article{arxiv.2404.06470,
title = {A Dataset and Framework for Learning State-invariant Object Representations},
author = {Rohan Sarkar and Avinash Kak},
journal= {arXiv preprint arXiv:2404.06470},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication