SlotMatch: 用于无监督视频分割的对象中心表示蒸馏
计算机视觉与模式识别
2025-11-19 v3 人工智能
摘要
无监督视频分割是计算机视觉中的一个具有挑战性的任务,尤其是由于缺乏监督信号以及视觉场景的复杂性。为克服这一挑战,基于 slot attention 的最新模型常常需要依赖大型且计算昂贵的神经网络结构。为此,我们提出一种简单有效的知识蒸馏框架,将对象中心表示有效传递给轻量级学生。所提出的框架称为 SlotMatch,通过余弦相似度对齐相应的教师和学生槽位,无需额外的蒸馏目标或辅助监督。SlotMatch 的简单性通过理论和实证证据得到确认,两者均表明额外损失的整合是冗余的。我们在三个数据集上进行实验,将与我们蒸馏后的学生进行比较,与最先进的教师模型 SlotContrast。结果显示,我们基于 SlotMatch 的学生模型在参数使用上仅为教师的 3.6 倍,运行速度提升最高可达 2.7 倍,同时性能不输甚至优于教师。此外,我们的学生模型超越了所有其他最先进的无监督视频分割模型。
引用
@article{arxiv.2508.03411,
title = {SlotMatch: Distilling Object-Centric Representations for Unsupervised Video Segmentation},
author = {Diana-Nicoleta Grigore and Neelu Madan and Andreas Mogelmose and Thomas B. Moeslund and Radu Tudor Ionescu},
journal= {arXiv preprint arXiv:2508.03411},
year = {2025}
}