动作分割需要多少长期时间上下文?
计算机视觉与模式识别
2023-09-26 v2 人工智能
机器学习
摘要
对视频中的长期上下文建模对于包括时间动作分割在内的许多细粒度任务至关重要。一个仍有待解决的有趣问题是,达到最优性能需要多少长期时间上下文。尽管Transformer可以建模视频的长期上下文,但对于长视频而言这在计算上难以承受。因此,近期关于时间动作分割的工作将时间卷积网络与仅在局部时间窗口内计算的自注意力相结合。尽管这些方法取得了良好结果,但其性能受限于无法捕获视频的完整上下文。在本工作中,我们通过引入一种基于Transformer的模型来尝试回答时间动作分割需要多少长期时间上下文的问题,该模型利用稀疏注意力来捕获视频的完整上下文。我们在三个时间动作分割数据集(即50Salads、Breakfast和Assembly101)上将我们的模型与当前最优方法进行比较。我们的实验表明,对视频完整上下文进行建模是获得时间动作分割最佳性能所必需的。
引用
@article{arxiv.2308.11358,
title = {How Much Temporal Long-Term Context is Needed for Action Segmentation?},
author = {Emad Bahrami and Gianpiero Francesca and Juergen Gall},
journal= {arXiv preprint arXiv:2308.11358},
year = {2023}
}
备注
ICCV 2023