中文

MPT-PAR:混合参数 Transformer 用于全景活动识别

计算机视觉与模式识别 2024-08-02 v1 人工智能

摘要

全景活动识别任务的目标是在拥挤和复杂环境中识别不同粒度的行为,包括个体动作、社交群体活动和全局活动。现有方法通常使用参数无关模块来捕获任务特定特征,或使用参数共享模块来获取所有任务的共同特征。然而,不同粒度的任务之间往往存在强烈的关联性和互补效应,这是先前方法尚未注意到的。在本文中,我们提出了一种名为 MPT-PAR 的模型,同时考虑每个任务的独特特征以及不同任务之间的协同效应,从而最大化多粒度活动识别中特征的利用。此外,我们通过引入时空关系增强模块和场景表征学习模块,强调了时间和空间信息的重要性,将动作的时空上下文和全局场景整合到每个粒度的特征图中。我们的方法在 JRDB-PAR 数据集上取得了 47.5% 的总体 F1 分数,显著优于所有现有最先进方法。

关键词

引用

@article{arxiv.2408.00420,
  title  = {MPT-PAR:Mix-Parameters Transformer for Panoramic Activity Recognition},
  author = {Wenqing Gan and Yan Sun and Feiran Liu and Xiangfeng Luo},
  journal= {arXiv preprint arXiv:2408.00420},
  year   = {2024}
}