中文

基于可变形注意力蒸馏学习的自监督视频目标分割

计算机视觉与模式识别 2024-03-19 v2

摘要

视频目标分割是计算机视觉中的一个基础研究问题。近期技术常将注意力机制应用于视频序列的目标表示学习。然而,由于视频数据中的时序变化,注意力图可能无法很好地与跨视频帧的感兴趣目标对齐,导致长期视频处理中的累积误差。此外,现有技术采用了复杂的架构,需要极高的计算复杂度,从而限制了将视频目标分割集成到低功耗设备中的能力。为解决这些问题,我们提出了一种基于可变形注意力蒸馏学习的自监督视频目标分割新方法。具体而言,我们设计了一种能有效适应时序变化的轻量级视频目标分割架构。这得益于可变形注意力机制,其中注意力模块中捕获视频序列记忆的键和值具有跨帧更新的灵活位置。因此,学习到的目标表示能够同时适应空间和时间维度。我们通过一种新的知识蒸馏范式以自监督方式训练所提出的架构,该范式将可变形注意力图集成到蒸馏损失中。我们在包括DAVIS 2016/2017和YouTube-VOS 2018/2019在内的基准数据集上对所提方法进行了定性和定量评估,并与现有方法进行了比较。实验结果通过其达到的最先进性能和最优内存使用,验证了我们方法的优越性。

关键词

引用

@article{arxiv.2401.13937,
  title  = {Self-supervised Video Object Segmentation with Distillation Learning of Deformable Attention},
  author = {Quang-Trung Truong and Duc Thanh Nguyen and Binh-Son Hua and Sai-Kit Yeung},
  journal= {arXiv preprint arXiv:2401.13937},
  year   = {2024}
}

备注

under review