中文

具有识别机制的可扩展视频对象分割

计算机视觉与模式识别 2024-05-29 v8

摘要

本文深入探讨半监督视频对象分割(VOS)中实现可扩展且高效的多对象建模所面临的挑战。以往的VOS方法以单一正对象解码特征,限制了多对象表征的学习,因为在多对象场景下它们必须分别匹配并分割每个目标。此外,早期技术针对特定应用目标,缺乏满足不同速度-精度要求的灵活性。为解决这些问题,我们提出两种创新方法:基于Transformer的对象关联(AOT)与基于可扩展Transformer的对象关联(AOST)。在追求高效多对象建模中,AOT引入识别(ID)机制为每个对象分配唯一身份,使网络能同时建模所有对象间的关联,从而在网络单次前向传播中完成对象的跟踪与分割。为应对部署不灵活的挑战,AOST进一步集成可扩展长短期Transformer,其包含可扩展监督与逐层基于ID的注意力,首次实现VOS中的在线架构可扩展性,并克服ID嵌入的表征局限。鉴于缺乏密集多对象标注的VOS基准,我们提出具有挑战性的野外视频对象分割(VOSW)基准以验证方法。我们在VOSW及五个常用VOS基准(包括YouTube-VOS 2018与2019验证集、DAVIS-2017验证集与测试集、DAVIS-2016)上通过大量实验评估了多种AOT与AOST变体。我们的方法在所有六个基准上一致超越当前最优竞争者,并展现出卓越的效率与可扩展性。项目页面:https://github.com/yoxu515/aot-benchmark。

关键词

引用

@article{arxiv.2203.11442,
  title  = {Scalable Video Object Segmentation with Identification Mechanism},
  author = {Zongxin Yang and Jiaxu Miao and Yunchao Wei and Wenguan Wang and Xiaohan Wang and Yi Yang},
  journal= {arXiv preprint arXiv:2203.11442},
  year   = {2024}
}

备注

Accepted by TPAMI 2024. Extension of arXiv:2106.02638 (NeurIPS 2021)