视频中社交群体、个体动作与子群活动的联合学习
计算机视觉与模式识别
2020-07-29 v2
摘要
当前视频流人体活动理解的最优方案将该任务表述为时空问题,需联合定位场景中所有个体并随时间分类其动作或群体活动。谁与谁交互(例如队列中并非人人彼此交互)通常未被预测。某些场景下,人员最好被划分为子群(我们称之为社交群体),且每个社交群体可能从事不同的社交活动。本文解决同时按社交交互将人分组、预测其个体动作及各社交群体社交活动的问题,我们称之为社交任务。主要贡献为:i)提出一种端到端可训练的社交任务框架;ii)所提方法在传统群体活动识别任务(假定场景个体构成单一群体并为场景预测单一群体活动标签)的两个广泛采用基准上也取得最优结果;iii)在已有群体活动数据集上引入新标注,将其改造用于社交任务。
引用
@article{arxiv.2007.02632,
title = {Joint Learning of Social Groups, Individuals Action and Sub-group Activities in Videos},
author = {Mahsa Ehsanpour and Alireza Abedin and Fatemeh Saleh and Javen Shi and Ian Reid and Hamid Rezatofighi},
journal= {arXiv preprint arXiv:2007.02632},
year = {2020}
}
备注
Accepted in the European Conference On Computer Vision (ECCV) 2020