ClickVOS:点击视频目标分割
计算机视觉与模式识别
2024-03-12 v1
摘要
视频目标分割 (VOS) 任务旨在分割视频中的目标。然而,以往的设置要么需要在推理过程中对第一帧的目标目标进行耗时的手动掩膜标注,要么缺乏指定任意感兴趣目标的灵活性。为解决这些局限性,我们提出了名为点击视频目标分割 (ClickVOS) 的设置,该设置根据第一帧中每个目标的一次点击,在整个视频中分割感兴趣的目标。我们提供了扩展数据集 DAVIS-P 和 YouTubeVOSP,其中包含点标注以支持该任务。ClickVOS 具有重要的实际应用和研究意义,因为其指示一个目标仅需 1-2 秒的交互时间,而标注一个目标的掩膜则需要数分钟。然而,ClickVOS 也带来了更大的挑战。为解决该任务,我们受人类注意力过程的启发,提出了一种名为分割前注意力 (ABS) 的端到端基线方法。ABS 利用第一帧中的给定点,通过简洁而有效的分割注意力来感知目标对象。虽然初始目标掩膜可能不准确,但在我们的 ABS 中,随着视频的进行,初始不精确的目标掩膜能够自我修复而非因误差累积而恶化,这归功于我们设计的改进记忆机制,该机制持续记录稳定的全局目标记忆并更新详细的密集记忆。此外,我们利用相关领域的现成算法进行了多种基线探索,可为 ClickVOS 的进一步研究提供见解。实验结果证明了所提出的 ABS 方法的优越性。扩展数据集和代码将在 https://github.com/PinxueGuo/ClickVOS 提供。
引用
@article{arxiv.2403.06130,
title = {ClickVOS: Click Video Object Segmentation},
author = {Pinxue Guo and Lingyi Hong and Xinyu Zhou and Shuyong Gao and Wanyun Li and Jinglun Li and Zhaoyu Chen and Xiaoqiang Li and Wei Zhang and Wenqiang Zhang},
journal= {arXiv preprint arXiv:2403.06130},
year = {2024}
}