A2VIS:面向视频实例分割的全视觉方法
计算机视觉与模式识别
2025-04-11 v2
摘要
在视频实例级任务(如多目标跟踪MOT和视频实例分割VIS)中处理遮挡仍是一个重要挑战。本文提出一种新型框架Amodal-Aware Video Instance Segmentation(A2VIS),通过融合全视觉表示来实现对视频中可见与遮挡部分目标的可靠且全面的理解。关键直觉是,通过时空维度实现对全视觉分段的感知,可提供稳定的目标信息流。当目标在视野中部分或完全遮挡时,全视觉分段相较于可见分段在时间轴上更具一致性且变化更小。因此,可以将所有片段中的全视觉和可见信息整合到一个全局实例原型中。为有效解决视频全视觉分段的挑战,我们引入时空先验全视觉掩码头,它在片内利用可见信息的同时提取片间的全视觉特征。通过大量实验和消融研究,我们展示A2VIS在MOT和VIS任务中表现卓越,能够精准识别和跟踪目标实例,展现出对其完整形状的深刻理解。
引用
@article{arxiv.2412.01147,
title = {A2VIS: Amodal-Aware Approach to Video Instance Segmentation},
author = {Minh Tran and Thang Pham and Winston Bounsavy and Tri Nguyen and Ngan Le},
journal= {arXiv preprint arXiv:2412.01147},
year = {2025}
}
备注
Accepted to IMAVIS. Project page: https://uark-aicv.github.io/A2VIS