动作分割中我们真的需要时间卷积吗?
计算机视觉与模式识别
2022-11-23 v2
摘要
动作分类已取得巨大进展,但从长未修剪视频中分割并识别动作仍具挑战性。多数最先进方法聚焦于设计基于时间卷积的模型,但时间卷积的缺乏灵活性以及建模长期时间依赖的困难限制了这些模型的潜力。具有自适应与序列建模能力的基于 Transformer 的模型近来被用于多种任务。然而,归纳偏置的缺失与处理长视频序列的低效限制了 Transformer 在动作分割中的应用。本文中,我们通过引入时间采样设计了一种无时间卷积的纯 Transformer 模型,称为 Temporal U-Transformer(TUT)。U-Transformer 架构在降低复杂度的同时引入了相邻帧更可能属于同一类的归纳偏置,但粗分辨率引入导致边界误分类。我们观察到边界帧与其邻帧的相似度分布取决于该边界帧是动作段的起点还是终点。因此,我们进一步提出基于注意力模块中帧间相似度分数分布的边界感知损失,以增强边界识别能力。大量实验证明了我们模型的有效性。
引用
@article{arxiv.2205.13425,
title = {Do we really need temporal convolutions in action segmentation?},
author = {Dazhao Du and Bing Su and Yu Li and Zhongang Qi and Lingyu Si and Ying Shan},
journal= {arXiv preprint arXiv:2205.13425},
year = {2022}
}