COMPOSER:基于仅关键点模态的视频群体活动组合推理
计算机视觉与模式识别
2022-07-26 v3
摘要
群体活动识别检测一组参与者共同执行的活动,这需要对参与者与物体进行组合推理。我们将视频建模为表示视频中多尺度语义概念的令牌(token),以此处理该任务。我们提出COMPOSER,一种基于多尺度Transformer的架构,它在每个尺度上对令牌执行基于注意力的推理,并以组合方式学习群体活动。此外,已有工作存在场景偏差及隐私与伦理问题。我们仅使用关键点模态,这减少了场景偏差,并避免获取可能包含用户私人或偏差信息的详细视觉数据。我们通过聚类中间尺度表示来改进COMPOSER中的多尺度表示,同时保持尺度间一致的聚类分配。最后,我们采用针对关键点信号定制的辅助预测与数据增强等技术来辅助模型训练。我们在两个广泛使用的数据集(Volleyball与Collective Activity)上展示了模型的性能与可解释性。COMPOSER仅用关键点模态即实现了最高+5.4%的提升。代码见 https://github.com/hongluzhou/composer
引用
@article{arxiv.2112.05892,
title = {COMPOSER: Compositional Reasoning of Group Activity in Videos with Keypoint-Only Modality},
author = {Honglu Zhou and Asim Kadav and Aviv Shamsian and Shijie Geng and Farley Lai and Long Zhao and Ting Liu and Mubbasir Kapadia and Hans Peter Graf},
journal= {arXiv preprint arXiv:2112.05892},
year = {2022}
}
备注
ECCV 2022