用于动作分割的交叉增强 Transformer
计算机视觉与模式识别
2022-05-20 v1
摘要
时间卷积一直是动作分割的首选范式,其通过增加卷积层来增强长程感受野。然而,高层数会导致帧识别所必需的局部信息丢失。为解决上述问题,本文提出了一种新颖的编码器-解码器结构,称为交叉增强 Transformer。我们的方法能够通过交互式自注意力机制有效学习时间结构表示。将编码器中每一层的卷积特征图与解码器中通过自注意力生成的一组特征进行拼接。因此,局部和全局信息在一系列帧动作中被同时使用。此外,提出了一种新的损失函数以增强训练过程,该函数对过分割错误进行惩罚。实验表明,我们的框架在三个具有挑战性的数据集上取得了最先进的性能:50Salads、Georgia Tech Egocentric Activities 和 Breakfast 数据集。
引用
@article{arxiv.2205.09445,
title = {Cross-Enhancement Transformer for Action Segmentation},
author = {Jiahui Wang and Zhenyou Wang and Shanna Zhuang and Hui Wang},
journal= {arXiv preprint arXiv:2205.09445},
year = {2022}
}