面向语言引导视频分割的局部-全局上下文感知 Transformer
计算机视觉与模式识别
2024-01-22 v2
摘要
我们探索语言引导视频分割(LVS)任务。以往算法多采用 3D CNN 学习视频表征,难以捕捉长期上下文且易出现视觉-语言错位。有鉴于此,我们提出 Locater(局部-全局上下文感知 Transformer),其通过有限记忆增强 Transformer 架构,从而以高效方式用语言表达查询整个视频。该记忆设计为包含两个组件——一个用于持久保存全局视频内容,一个用于动态聚合局部时间上下文与分割历史。基于记忆的局部-全局上下文及各帧的特定内容,Locater 整体且灵活地将表达理解为每帧的自适应查询向量。该向量用于查询对应帧以生成掩码。该记忆还使 Locater 能以线性时间复杂度和恒定大小记忆处理视频,而 Transformer 风格的自注意力计算随序列长度呈二次增长。为充分检验 LVS 模型的视觉定位能力,我们贡献了一个新的 LVS 数据集 A2D-S+,其构建于 A2D-S 数据集之上,但在区分相似物体方面提出了更大挑战。在三个 LVS 数据集及我们的 A2D-S+ 上的实验表明 Locater 优于以往最优方法。此外,我们在第三届大规模视频对象分割挑战赛的参照视频对象分割赛道获得第一名,Locater 作为获胜方案的基础。我们的代码与数据集见:https://github.com/leonnnop/Locater
引用
@article{arxiv.2203.09773,
title = {Local-Global Context Aware Transformer for Language-Guided Video Segmentation},
author = {Chen Liang and Wenguan Wang and Tianfei Zhou and Jiaxu Miao and Yawei Luo and Yi Yang},
journal= {arXiv preprint arXiv:2203.09773},
year = {2024}
}
备注
Accepted by TPAMI. Code, data: https://github.com/leonnnop/Locater