GRAtt-VIS:用于自动校正视频实例分割的门控残差注意力
计算机视觉与模式识别
2023-05-29 v1
摘要
近期视频实例分割(VIS)的趋势是日益依赖在线方法对复杂且冗长的视频序列建模。然而,在线方法的表征退化和噪声累积,尤其在遮挡与突变期间,带来了重大挑战。基于 Transformer 的查询传播以二次记忆注意力为代价提供了有前景的方向。但它们易受上述挑战导致的实例特征退化影响,并遭受级联效应。此类错误的检测与校正在很大程度上仍未被充分探索。为此,我们提出 \textbf{GRAtt-VIS},即用于\textbf{视频实例分割}的\textbf{门控残差注意力}(\textbf{G}ated \textbf{R}esidual \textbf{Att}ention for \textbf{V}ideo \textbf{I}nstance \textbf{S}egmentation)。首先,我们利用基于 Gumbel-Softmax 的门来检测当前帧中可能的错误。接着,基于门激活,我们从其过往表征中校正退化的特征。这种残差配置减轻了对专用记忆的需求,并提供连续的相关实例特征流。其次,我们提出一种新颖的实例间交互,使用门激活作为自注意力的掩码。该掩码策略动态限制自注意力中无代表性的实例查询,并为长期跟踪保留关键信息。我们将这种门控残差连接与掩码自注意力的新颖组合称为 \textbf{GRAtt} 块,其可轻松集成到现有的基于传播的框架中。此外,GRAtt 块显著降低了注意力开销并简化了动态时间建模。GRAtt-VIS 在 YouTube-VIS 和高度挑战性的 OVIS 数据集上取得了最先进的性能,显著优于先前方法。代码见 \url{https://github.com/Tanveer81/GRAttVIS}。
引用
@article{arxiv.2305.17096,
title = {GRAtt-VIS: Gated Residual Attention for Auto Rectifying Video Instance Segmentation},
author = {Tanveer Hannan and Rajat Koner and Maximilian Bernhard and Suprosanna Shit and Bjoern Menze and Volker Tresp and Matthias Schubert and Thomas Seidl},
journal= {arXiv preprint arXiv:2305.17096},
year = {2023}
}
备注
14 pages, 5 tables, 9 figures