浅层特征至关重要:基于异构互动的层次化记忆无监督视频对象分割
计算机视觉与模式识别
2025-07-31 v1 人工智能
摘要
无监督视频对象分割(UVOS)旨在在没有任何先验注释的情况下预测视频中最显著对象的像素级掩码。尽管记忆机制在各种视频分割范式中被证明至关重要,但在UVOS中的应用仅产生有限的性能提升。我们分析发现,现有方法存在一个简单却根本的缺陷:过度依赖记忆高级别语义特征。UVOS本身因缺乏像素级先验知识而天然存在细粒度信息不足的问题。因此,仅依赖高级别特征进行的记忆设计——这些特征主要捕获抽象语义线索——不足以生成精确的预测。为解决这一根本问题,我们提出一种新型的层次化记忆架构,用于记忆中集成浅层和高级别特征,充分利用像素和语义信息的互补优势。此外,为平衡像素和语义记忆特征的同步利用,我们提出一种异构互动机制,用于执行像素-语义相互作用,显式考虑其固有的特征差异。通过设计像素引导的局部对齐模块(PLAM)和语义引导的全局集成模块(SGIM),我们实现了浅层记忆中细粒度细节与高层记忆中语义表征的精细集成。我们的层次化记忆异构互动网络(HMHI-Net)在所有UVOS和视频视觉检测基准测试中均实现了最先进的性能。此外,HMHI-Net在不同主干网络上表现出色,进一步证明了其优势和鲁棒性。项目页面: https://github.com/ZhengxyFlow/HMHI-Net。
引用
@article{arxiv.2507.22465,
title = {Shallow Features Matter: Hierarchical Memory with Heterogeneous Interaction for Unsupervised Video Object Segmentation},
author = {Zheng Xiangyu and He Songcheng and Li Wanyun and Li Xiaoqiang and Zhang Wei},
journal= {arXiv preprint arXiv:2507.22465},
year = {2025}
}
备注
Accepted to ACM MM'25: The 33rd ACM International Conference on Multimedia Proceedings