Motion-Refined DINOSAUR 用于无监督多目标发现
计算机视觉与模式识别
2025-09-03 v1
摘要
无监督多目标发现(MOD)旨在没有任何人类监督的情况下检测和定位视觉场景中的独特目标实例。最近的研究方法利用对象中心学习(OCL)和视频中的运动线索来识别单个目标。然而,这些方法使用监督来生成伪标签来训练 OCL 模型。我们提出了 MR-DINOSAUR -- Motion-Refined DINOSAUR --一种 minimalistic 的无监督方法,将已预训练的自监督 OCL 模型 DINOSAUR 扩展到无监督多目标发现任务。我们通过检索无相机运动的视频帧来生成高质量的无监督伪标签,并对这些帧进行无监督光流运动分割。我们使用这些伪标签细化 DINOSAUR 的 slot 表示,并训练一个 slot deactivation 模块来分配前景和背景。尽管概念上简单,MR-DINOSAUR 在 TRI-PD 和 KITTI 数据集上实现了强大的多目标发现结果,超过了前一时代的最佳成绩,完全无监督。
引用
@article{arxiv.2509.02545,
title = {Motion-Refined DINOSAUR for Unsupervised Multi-Object Discovery},
author = {Xinrui Gong and Oliver Hahn and Christoph Reich and Krishnakant Singh and Simone Schaub-Meyer and Daniel Cremers and Stefan Roth},
journal= {arXiv preprint arXiv:2509.02545},
year = {2025}
}
备注
To appear at ICCVW 2025. Xinrui Gong and Oliver Hahn - both authors contributed equally. Code: https://github.com/visinf/mr-dinosaur