中文

LocATe:基于 Transformers 的 3D 动作端到端定位

计算机视觉与模式识别 2022-03-22 v1 人工智能

摘要

从人的 3D 运动中理解其行为是计算机视觉中一个具有众多应用的基础问题。该问题的一个重要组成部分是 3D 时序动作定位(3D-TAL),其涉及识别人正在执行什么动作以及何时执行。最先进的 3D-TAL 方法采用两阶段方案,将动作跨度检测任务与动作识别任务以级联方式实现。然而,这种方法限制了纠错的可能性。相比之下,我们提出 LocATe,一种端到端方法,在 3D 序列中联合定位并识别动作。此外,不同于现有聚焦于建模序列局部上下文的自回归模型,LocATe 的 transformer 模型能够捕捉序列中动作间的长程关联。不同于以图像或图像块特征为输入的基于 transformer 的目标检测与分类模型,3D-TAL 的输入是高度相关的长帧序列。为处理高维输入,我们实现了一种有效的输入表示,并通过在模型中引入稀疏注意力来克服跨长时间范围的分散注意力。LocATe 在现有 PKU-MMD 3D-TAL 基准上优于以往方法(mAP=93.2%)。最后,我们认为基准数据集在存在明确性能提升空间时最为有用。为此,我们引入了一个新的、具挑战性且更现实的基准数据集 BABEL-TAL-20 (BT20),其中最先进方法的性能明显更差。该方法的数据集与代码将公开供研究使用。

关键词

引用

@article{arxiv.2203.10719,
  title  = {LocATe: End-to-end Localization of Actions in 3D with Transformers},
  author = {Jiankai Sun and Bolei Zhou and Michael J. Black and Arjun Chandrasekaran},
  journal= {arXiv preprint arXiv:2203.10719},
  year   = {2022}
}