中文

使用质心三元组损失学习嵌入以进行机器人抓取中的物体识别

计算机视觉与模式识别 2024-07-09 v2

摘要

基础模型是深度学习和计算机视觉领域的一个强劲趋势。这些模型作为应用的基础,因为开发者只需很少或无需进一步微调即可将其集成到应用中。用于零样本物体分割的基础模型(如Segment Anything (SAM))能从图像中输出分割掩码,而无需任何额外的物体信息。当它们在流水线中与物体识别模型衔接时,可以在无需训练的情况下执行物体检测。本文专注于训练这样的物体识别模型。物体识别模型的一个关键实际方面是输入尺寸的灵活性。由于物体识别是一个图像检索问题,合适的方法应能处理多查询多图库的情况,而不限制输入图像的数量(例如通过固定大小的聚合层)。训练此类模型的关键解决方案是质心三元组损失(CTL),它将图像特征聚合到其质心。CTL具有高精度,避免误导性训练信号,并保持模型输入尺寸的灵活性。在我们的实验中,我们在ArmBench物体识别任务上建立了新的最先进水平,这显示了模型的通用适用性。此外,我们在具有挑战性的HOPE数据集上展示了一个集成的未见物体检测流水线,该数据集需要细粒度检测。在那里,我们的流水线匹配并超越了在特定数据集上训练的相关方法。

关键词

引用

@article{arxiv.2404.06277,
  title  = {Learning Embeddings with Centroid Triplet Loss for Object Identification in Robotic Grasping},
  author = {Anas Gouda and Max Schwarz and Christopher Reining and Sven Behnke and Alice Kirchheim},
  journal= {arXiv preprint arXiv:2404.06277},
  year   = {2024}
}

备注

Accepted to CASE 2024