基于多演员预测学习的自监督社交活动理解(流式视频)
计算机视觉与模式识别
2024-06-21 v1
摘要
本工作针对社交活动识别 (SAR) 这一问题进行了研究,这是实际任务(如监视和助理机器人)中的关键组件。不同于传统事件理解方法,SAR 需要建模单个演员的外观和动作,并将其在社交互动中加以上下文化。传统的动作局化方法不足,因为其假设为单演员、单动作。以往的 SAR 研究高度依赖密集标注数据,但由于隐私问题,其实际应用受到限制。在本工作中,我们提出了一种基于多演员预测学习的自监督方法,用于流式视频中的 SAR。通过构建视觉-语义图结构,我们对社交互动进行建模,实现对关系推理的稳健性能,同时仅需少量标注数据。该框架在标准的团体活动识别基准数据集上实现了具竞争力的性能。评估在三个公开可用的动作局化基准数据集上表明,其对任意动作局化具有良好的通用性。
引用
@article{arxiv.2406.14472,
title = {Self-supervised Multi-actor Social Activity Understanding in Streaming Videos},
author = {Shubham Trehan and Sathyanarayanan N. Aakur},
journal= {arXiv preprint arXiv:2406.14472},
year = {2024}
}
备注
16 pages, 2 figures, 4 pages