中文

MAGIC-TBR:基于 Transformer 的多视角注意力融合群体体态行为识别

计算机视觉与模式识别 2023-09-20 v1 人机交互 多媒体

摘要

体态行为语言是一种重要的社交线索,其自动化分析有助于增强人工智能系统的理解能力。此外,行为语言线索对于基于社交智能体的用户交互中的积极参与至关重要。尽管计算机视觉在头部与身体姿态估计等任务上已取得进展,仍亟需探索诸如手势、梳理或摆弄等更精细行为的检测。本文提出一种名为 MAGIC-TBR 的多视角注意力融合方法,通过基于 Transformer 的方法将视频及其对应的离散余弦变换系数中提取的特征相融合。实验在 BBSI 数据集上进行,结果证明了所提多视角注意力特征融合的有效性。代码见:https://github.com/surbhimadan92/MAGIC-TBR

关键词

引用

@article{arxiv.2309.10765,
  title  = {MAGIC-TBR: Multiview Attention Fusion for Transformer-based Bodily Behavior Recognition in Group Settings},
  author = {Surbhi Madan and Rishabh Jain and Gulshan Sharma and Ramanathan Subramanian and Abhinav Dhall},
  journal= {arXiv preprint arXiv:2309.10765},
  year   = {2023}
}

备注

4 pages, 2 Tables and 3 Figures