中文

ASFormer:用于动作分割的 Transformer

计算机视觉与模式识别 2021-10-19 v1

摘要

动作分割任务的算法通常使用时序模型来预测长达一分钟的日常活动中每一帧所发生的动作。近期研究显示了 Transformer 在建模序列数据元素间关系的潜力。然而,将 Transformer 直接应用于动作分割任务存在若干主要问题,例如在小训练集下缺乏归纳偏置、处理长输入序列的不足,以及解码器架构难以利用多个动作段间的时序关系来精炼初始预测。为解决这些问题,我们设计了一个高效的基于 Transformer 的动作分割模型,称为 ASFormer,具有三个显著特点:(i) 由于特征的高局部性,我们显式引入局部连接归纳先验。它将假设空间约束在可靠范围内,并有助于动作分割任务用小训练集学习恰当的目标函数。(ii) 我们应用预定义的层次化表示模式来高效处理长输入序列。(iii) 我们精心设计了解码器以精炼来自编码器的初始预测。在三个公开数据集上的大量实验证明了我们方法的有效性。代码见 \url{https://github.com/ChinaYi/ASFormer}。

关键词

引用

@article{arxiv.2110.08568,
  title  = {ASFormer: Transformer for Action Segmentation},
  author = {Fangqiu Yi and Hongyu Wen and Tingting Jiang},
  journal= {arXiv preprint arXiv:2110.08568},
  year   = {2021}
}

备注

Accepted by BMVC 2021