中文

用于基于骨架的通用交互动作识别的交互时空令牌注意力网络

计算机视觉与模式识别 2024-01-09 v1 人工智能 机器人学

摘要

识别交互动作在人机交互与协作中起着重要作用。以往方法使用后期融合与协同注意力机制来捕捉交互关系,其学习能力有限或难以高效适应更多交互实体。在假设各实体先验已知的前提下,它们也缺乏对面向主体多样性这一更通用设定的评估。为解决这些问题,我们提出交互时空令牌注意力网络(ISTA-Net),其同时建模空间、时间与交互关系。具体而言,我们的网络包含一个分词器(tokenizer)来划分交互时空令牌(ISTs),这是一种表示多个不同实体运动的统一方式。通过扩展实体维度,ISTs 提供了更好的交互表示。为沿 ISTs 的三维联合学习,设计了集成 3D 卷积的多头自注意力模块以捕捉令牌间关联。在对关联建模时,严格的实体顺序对识别交互动作通常无关紧要。为此,提出实体重排(Entity Rearrangement)以消除 ISTs 中可互换实体的有序性。在四个数据集上的大量实验表明 ISTA-Net 优于当前最优方法,验证了有效性。我们的代码公开于 https://github.com/Necolizer/ISTA-Net

关键词

引用

@article{arxiv.2307.07469,
  title  = {Interactive Spatiotemporal Token Attention Network for Skeleton-based General Interactive Action Recognition},
  author = {Yuhang Wen and Zixuan Tang and Yunsheng Pang and Beichen Ding and Mengyuan Liu},
  journal= {arXiv preprint arXiv:2307.07469},
  year   = {2024}
}

备注

IROS 2023 Camera-ready version. Project website: https://necolizer.github.io/ISTA-Net/