Action-slot:面向交通场景多标签原子活动识别的视觉动作中心表示
计算机视觉与模式识别
2024-04-23 v2 机器学习
摘要
本文中,我们研究多标签原子活动识别。尽管动作识别取得了显著进展,由于缺乏对多个道路使用者运动及其上下文信息的整体理解,识别原子活动仍具挑战性。本文我们引入Action-slot,一种基于槽注意力的方法,学习捕获运动与上下文信息的视觉动作中心表示。我们的核心思想是设计能够关注原子活动发生区域、且无需显式感知引导的动作槽。为进一步增强槽注意力,我们引入一个与动作槽竞争的背景槽,辅助训练过程避免不必要地聚焦于无活动的背景区域。然而,现有数据集中类别分布不平衡妨碍了对稀有活动的评估。为解决该局限,我们收集了一个称为TACO的合成数据集,其规模是OATS的四倍且具平衡的原子活动分布。为验证方法有效性,我们针对多种动作识别基线开展了全面实验与消融研究。我们还表明,通过在TACO上预训练表示可提升在真实世界数据集上的多标签原子活动识别性能。我们将发布源代码与数据集。可视化视频见项目页:https://hcis-lab.github.io/Action-slot/
引用
@article{arxiv.2311.17948,
title = {Action-slot: Visual Action-centric Representations for Multi-label Atomic Activity Recognition in Traffic Scenes},
author = {Chi-Hsi Kung and Shu-Wei Lu and Yi-Hsuan Tsai and Yi-Ting Chen},
journal= {arXiv preprint arXiv:2311.17948},
year = {2024}
}