LTCA:用于指称视频对象分割的长程时间上下文注意力
计算机视觉与模式识别
2025-10-10 v1
摘要
指称视频分割(RVOS)旨在根据给定的语言表达式对视频中的对象进行分割。解决 RVOS 的关键在于从表达式与视频的交互中提取长程时间上下文信息,以刻画每个对象的动态属性。先前的工作要么采用跨所有帧的注意力,要么堆叠密集局部注意力以获得时间上下文的全局视图。然而,它们未能在局部性与全局性之间取得良好平衡,且计算复杂度随视频长度的增加而显著上升。本文提出了一种有效的长程时间上下文注意力(LTCA)机制,用于将全局上下文信息聚合到对象特征中。具体而言,我们从两个方面聚合全局上下文信息。首先,我们堆叠稀疏局部注意力以平衡局部性与全局性。我们设计了跨帧的膨胀窗口注意力来聚合局部上下文信息,并通过多层堆叠实现全局视图。此外,我们使每个查询能够关注从全局池中随机选取的一小组键,以增强全局性。其次,我们设计了一个全局查询与所有其他查询进行交互,以直接编码全局上下文信息。实验结果表明,我们的方法在四个指称视频分割基准上取得了新的最先进性能。特别地,我们的方法在 MeViS valu 和 val 数据集上分别提升了 11.3% 和 8.3%。
引用
@article{arxiv.2510.08305,
title = {LTCA: Long-range Temporal Context Attention for Referring Video Object Segmentation},
author = {Cilin Yan and Jingyun Wang and Guoliang Kang},
journal= {arXiv preprint arXiv:2510.08305},
year = {2025}
}
备注
Accepted by IEEE TCSVT