BIT:用于高效监督动作分割的双层时间建模
计算机视觉与模式识别
2023-10-10 v2
摘要
我们解决监督动作分割任务,其旨在将视频划分为互不重叠的片段,每个片段表示不同动作。近期工作应用 transformer 在帧级进行时间建模,但计算成本高且不能很好地捕捉长时域上的动作依赖。为解决这些问题,我们提出一种高效的双层时间建模(BIT)框架,其学习显式动作令牌以表示动作片段,并行地在帧级与动作级进行时间建模,同时保持较低计算成本。我们的模型包含(i)使用卷积学习帧级关系的帧分支,(ii)使用 transformer 以少量动作令牌学习动作级依赖的动作分支,以及(iii)允许两分支间通信的交叉注意力。我们应用并扩展集合预测目标,使每个动作令牌可表示一个或多个动作片段,从而避免在长期含多片段视频上学习大量令牌。得益于动作分支的设计,我们还可无缝利用视频文本转写(若可用)来初始化动作令牌以辅助动作分割。我们在四个视频数据集(两个第一人称与两个第三人称)上评估有无转写下的动作分割,表明 BIT 相较现有基于 transformer 的方法以低得多的计算成本(快 30 倍)显著提升了 SOTA 精度。
引用
@article{arxiv.2308.14900,
title = {BIT: Bi-Level Temporal Modeling for Efficient Supervised Action Segmentation},
author = {Zijia Lu and Ehsan Elhamifar},
journal= {arXiv preprint arXiv:2308.14900},
year = {2023}
}
备注
9 pages, 6 figures