HAtt-Flow:用于视频中群体活动场景图生成的层次注意力流机制
计算机视觉与模式识别
2024-10-23 v1
摘要
群体活动场景图 (GASG) 生成是计算机视觉中一项具有挑战性的任务,旨在预测和描述视频序列中主体与客体之间的关系。传统的视频场景图生成 (VidSGG) 方法侧重于回顾性分析,限制了其预测能力。为丰富场景理解能力,我们引入了一个 GASG 数据集,该数据集扩展了 JRDB 数据集,增加了涉及外观、交互、位置、关系和情境属性的细致标注。本工作还引入了一种创新方法——层次注意力流 (HAtt-Flow) 机制,该机制植根于流网络理论,以提升 GASG 性能。流注意力融合了流守恒原理,促进了源头的竞争和汇点的分配,有效防止了平凡注意力的产生。我们提出的方法为注意力机制提供了一个独特的视角,其中传统的“值”和“键”分别转化为源和汇,为基于注意力的模型创建了一个新颖的框架。通过大量实验,我们证明了 HAtt-Flow 模型的有效性以及我们提出的流注意力机制的优越性。本工作代表了预测性视频场景理解方面的重大进展,为需要视频数据中实时关系预测的应用提供了宝贵的见解和技术。
引用
@article{arxiv.2312.07740,
title = {HAtt-Flow: Hierarchical Attention-Flow Mechanism for Group Activity Scene Graph Generation in Videos},
author = {Naga VS Raviteja Chappa and Pha Nguyen and Thi Hoang Ngan Le and Khoa Luu},
journal= {arXiv preprint arXiv:2312.07740},
year = {2024}
}
备注
11 pages, 5 figures, 6 tables