中文

视频中社交群体、个体动作与子群活动的联合学习

计算机视觉与模式识别 2020-07-29 v2

摘要

当前视频流人体活动理解的最优方案将该任务表述为时空问题,需联合定位场景中所有个体并随时间分类其动作或群体活动。谁与谁交互(例如队列中并非人人彼此交互)通常未被预测。某些场景下,人员最好被划分为子群(我们称之为社交群体),且每个社交群体可能从事不同的社交活动。本文解决同时按社交交互将人分组、预测其个体动作及各社交群体社交活动的问题,我们称之为社交任务。主要贡献为:i)提出一种端到端可训练的社交任务框架;ii)所提方法在传统群体活动识别任务(假定场景个体构成单一群体并为场景预测单一群体活动标签)的两个广泛采用基准上也取得最优结果;iii)在已有群体活动数据集上引入新标注,将其改造用于社交任务。

关键词

引用

@article{arxiv.2007.02632,
  title  = {Joint Learning of Social Groups, Individuals Action and Sub-group Activities in Videos},
  author = {Mahsa Ehsanpour and Alireza Abedin and Fatemeh Saleh and Javen Shi and Ian Reid and Hamid Rezatofighi},
  journal= {arXiv preprint arXiv:2007.02632},
  year   = {2020}
}

备注

Accepted in the European Conference On Computer Vision (ECCV) 2020