中文

基于时间解析Transformer的动作质量评估

计算机视觉与模式识别 2022-07-20 v1

摘要

动作质量评估(AQA)对于动作理解十分重要,但由于细微的视觉差异,解决该任务面临独特挑战。现有的最先进方法通常依赖整体视频表示进行分数回归或排序,这限制了捕捉细粒度类内变化的泛化能力。为克服上述局限,我们提出一种时间解析Transformer,将整体特征分解为时间部件级表示。具体而言,我们利用一组可学习查询来表示特定动作的原子时间模式。我们的解码过程将帧表示转换为固定数量的时间有序部件表示。为获得质量分数,我们基于部件表示采用了最先进的对比回归。由于现有AQA数据集不提供时间部件级标签或划分,我们针对解码器的交叉注意力响应提出了两种新颖损失函数:一种排序损失以确保可学习查询满足交叉注意力中的时间顺序,一种稀疏损失以促使部件表示更具判别性。大量实验表明,我们所提方法在三个公开AQA基准上以显著优势超越先前工作。

关键词

引用

@article{arxiv.2207.09270,
  title  = {Action Quality Assessment with Temporal Parsing Transformer},
  author = {Yang Bai and Desen Zhou and Songyang Zhang and Jian Wang and Errui Ding and Yu Guan and Yang Long and Jingdong Wang},
  journal= {arXiv preprint arXiv:2207.09270},
  year   = {2022}
}

备注

accepted by ECCV 2022