中文

视频中以人为中心的行为描述:新基准与模型

计算机视觉与模式识别 2023-10-05 v1

摘要

在视频监控领域,描述视频中每个个体的行为正变得愈发重要,尤其在存在多个个体的复杂场景中。这是因为描述每个个体的行为可提供更细致的态势分析,从而能够准确评估并响应潜在风险,保障公共场所的安全与和谐。当前,视频级描述数据集无法为每个个体的具体行为提供细粒度描述。然而,仅停留在视频级的描述难以深入解读个体行为,导致难以准确判定每个个体的具体身份。为应对此挑战,我们构建了一个以人为中心的视频监控描述数据集,对 7,820 个个体的动态行为提供了详细描述。具体而言,我们标注了每个人的若干方面,如位置、衣着及与场景中其他元素的交互,这些人分布于 1,012 段视频中。基于该数据集,我们可将个体与其各自行为相关联,从而进一步分析监控视频中每人的行为。除数据集外,我们提出了一种新颖的视频描述方法,能够在人员层级上详细刻画个体行为,取得了最先进(state-of-the-art)的结果。为促进该领域进一步研究,我们计划发布数据集与代码。

关键词

引用

@article{arxiv.2310.02894,
  title  = {Human-centric Behavior Description in Videos: New Benchmark and Model},
  author = {Lingru Zhou and Yiqi Gao and Manqing Zhang and Peng Wu and Peng Wang and Yanning Zhang},
  journal= {arXiv preprint arXiv:2310.02894},
  year   = {2023}
}