中文

VrdONE: 单阶段视频视觉关系检测

计算机视觉与模式识别 2024-10-17 v2

摘要

视频视觉关系检测(VidVRD)关注实体在视频中的时空交互方式,是超越基础视觉任务、深入理解视频场景的关键步骤。传统VidVRD方法因任务复杂性面临挑战,通常将任务拆分为两部分:一部分用于识别存在的关系类别,另一部分用于确定其时间边界。这种拆分忽略了这些元素之间的内在联系。为识别实体对在不同持续时间范围内的时空交互,我们提出VrdONE,一个简洁而高效的单阶段模型。VrdONE结合主语和宾语特征,将谓词检测转化为在其联合表示上的一维实例分割。该设置可一次性完成关系类别识别与二进制掩码生成,无需额外的提案生成或后处理步骤。VrdONE促进不同帧之间的特征交互,精准捕获短暂和持久的关系。此外,我们引入主语-宾语协同(Subject-Object Synergy, SOS)模块,增强主语和宾语在组合前的相互感知。VrdONE在VidOR基准和ImageNet-VidVRD上取得了最先进的性能,展示了其在不同时间尺度上辨识关系的卓越能力。代码可在 https://github.com/lucaspk512/vrdone 获取。

关键词

引用

@article{arxiv.2408.09408,
  title  = {VrdONE: One-stage Video Visual Relation Detection},
  author = {Xinjie Jiang and Chenxi Zheng and Xuemiao Xu and Bangzhen Liu and Weiying Zheng and Huaidong Zhang and Shengfeng He},
  journal= {arXiv preprint arXiv:2408.09408},
  year   = {2024}
}

备注

12 pages, 8 figures, accepted by ACM Multimedia 2024