看什么与何时看?:面向视频关系检测的时间跨度提议网络
计算机视觉与模式识别
2024-10-28 v2 人工智能
摘要
识别物体之间的关系是理解场景的核心。尽管已有若干工作针对图像领域的关系建模展开,但由于时空交互的动态性极具挑战(例如,哪些物体之间存在交互?关系何时开始与结束?),视频领域一直存在诸多限制。迄今为止,已有两种代表性方法被提出以应对视频视觉关系检测(VidVRD):基于片段的方法和基于窗口的方法。我们首先指出这些方法的局限性,并提出一种名为时间跨度提议网络(Temporal Span Proposal Network, TSPN)的新方法。TSPN 告知看什么:它通过为物体对的关系性打分(即衡量关系存在的概率)来稀疏化关系搜索空间。TSPN 告知何时看:它利用完整视频上下文同时预测所有可能关系的起止时间戳(即时间跨度)与类别。这两项设计实现了双赢:它将训练速度提升至现有方法的 2 倍或以上,并在两个 VidVRD 基准(ImageNet-VidVDR 和 VidOR)上取得具有竞争力的性能。此外,全面的消融实验证明了我们方法的有效性。代码见 https://github.com/sangminwoo/Temporal-Span-Proposal-Network-VidVRD。
引用
@article{arxiv.2107.07154,
title = {What and When to Look?: Temporal Span Proposal Network for Video Relation Detection},
author = {Sangmin Woo and Junhyug Noh and Kangil Kim},
journal= {arXiv preprint arXiv:2107.07154},
year = {2024}
}
备注
This work has been submitted to the IEEE for possible publication