中文

面向指代视频对象分割的多上下文时间一致性建模

计算机视觉与模式识别 2025-01-16 v2

摘要

指代视频对象分割旨在根据给定的文本描述分割视频中的对象。现有的基于Transformer的时间建模方法面临查询不一致和上下文考虑有限的问题。查询不一致会在视频中间产生不同对象的不稳定掩码。上下文考虑有限导致未能充分考虑给定文本与实例之间的关系,从而分割出错误的对象。为解决这些问题,我们提出了多上下文时间一致性模块(MTCM),它由一个对齐器和一个多上下文增强器(MCE)组成。对齐器去除查询中的噪声并对齐它们以实现查询一致性。MCE通过考虑多上下文来预测与文本相关的查询。我们将MTCM应用于四个不同的模型,所有模型的性能均得到提升,特别是在MeViS上达到了47.6 J&F。代码可在https://github.com/Choi58/MTCM获取。

关键词

引用

@article{arxiv.2501.04939,
  title  = {Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation},
  author = {Sun-Hyuk Choi and Hayoung Jo and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2501.04939},
  year   = {2025}
}

备注

Comment: Accepted to ICASSP 2025