中文

面向设备内个人物品搜索的高效且多功能的视觉框架——Swiss DINO

计算机视觉与模式识别 2024-07-11 v1 人工智能 机器人学

摘要

本文针对近年来在机器人家居设备中引入面向个人的视觉系统趋势进行研究,这类系统能够动态为家居设备提供个性化功能。具体而言,我们提出并解决了一个重要的技术任务,即个人物品搜索,即在由机器人家居设备捕获的图像中定位和识别感兴趣的个人物品(每个物品仅通过少量标注图像进行引用)。该任务对机器人家居设备和移动系统至关重要,因为它们需要处理个人视觉场景或操作特定的个人物品(例如用于抓取或导航)。在实际应用中,个人物品搜索提出了两个主要技术挑战:其一,机器人视觉系统需要能够在遮挡和杂乱环境下区分众多细粒度类别;其二,面向设备的系统对资源有严格要求,限制了大多数基于少样本学习和常规方法的使用,常规方法往往无法实现设备内适应。在本工作中,我们提出 Swiss DINO:一个基于最新 DINOv2 transformer 模型的简单而有效的框架,用于单样本个人物品搜索。DINOv2 transformer 模型已显示出强大的零样本泛化性能。Swiss DINO 处理了挑战性的面向设备的个人场景理解需求,且无需任何适应性训练。我们显示,与常见轻量级解决方案相比,在分割和识别准确率上提升了最高 55%;与重型 transformer 方案相比,主干网络推理时间(最高可降低 100 倍)和 GPU 消耗(最高可降低 10 倍)显著降低。

关键词

引用

@article{arxiv.2407.07541,
  title  = {Swiss DINO: Efficient and Versatile Vision Framework for On-device Personal Object Search},
  author = {Kirill Paramonov and Jia-Xing Zhong and Umberto Michieli and Jijoong Moon and Mete Ozay},
  journal= {arXiv preprint arXiv:2407.07541},
  year   = {2024}
}

备注

8 pages, 2 figures, accepted to IROS2024