分离注意力:基于上下文分隔槽的无监督多目标发现
计算机视觉与模式识别
2025-08-01 v3 人工智能
机器学习
摘要
我们研究了在无任何语义标注情况下视觉感知中目标的涌现。所得模型未接受任何监督,未使用任何预训练特征,却能将图像域分割为多个独立运动的区域。所得运动分割方法能实时处理未知且变化数量的目标。核心多模态条件编码器-解码器架构以一种模态(光流)输入编码器产生一组潜码(槽),另一模态(彩色图像)条件化解码器从槽生成第一模态(流)。训练准则旨在促进槽间的“信息分离”,而架构将激活显式分配给各个槽,从而得到我们称为分离注意力(DivA)的方法。测试时,DivA 处理与训练时不同的目标数量和图像分辨率,且对槽的排列不变。DivA 实现了最先进性能,同时将可比方法的运行速度提升至三倍,达 104 FPS,并将与有监督方法的性能差距缩小至 12% 或更小。DivA 自举的目标随后可通过对比学习来启动静态分类器。在少于 5,000 个视频片段上,在 DivA 的目标提议上训练 DINO 相比直接在视频帧上训练,将到基于 ImageNet 训练的差距缩小了至多 30.2%。
引用
@article{arxiv.2304.01430,
title = {Divided Attention: Unsupervised Multi-Object Discovery with Contextually Separated Slots},
author = {Dong Lao and Zhengyang Hu and Francesco Locatello and Yanchao Yang and Stefano Soatto},
journal= {arXiv preprint arXiv:2304.01430},
year = {2025}
}