细察视觉关系:基于解耦标签学习的无偏视频场景图生成
计算机视觉与模式识别
2023-03-24 v1
摘要
当前的基于视频的场景图生成(VidSGG)方法被发现在预测训练数据中代表性不足的关系谓词时表现不佳,这是由于训练数据固有的偏置分布所致。在本文中,我们仔细考察谓词并发现大多数视觉关系(如 sit_above)同时涉及动作模式(sit)与空间模式(above),而在模式层面上分布偏置要轻得多。基于这一洞察,我们提出解耦标签学习(DLL)范式,从模式层面解决棘手的视觉关系预测问题。具体而言,DLL 解耦谓词标签并采用独立分类器分别学习动作与空间模式。随后将这些模式组合并映射回谓词。此外,我们提出一种知识层面的标签解耦方法,将非目标知识从头部谓词迁移至同一模式下的尾部谓词,以校准尾部类的分布。我们在常用 VidSGG 基准即 VidVRD 上验证了 DLL 的有效性。大量实验表明,DLL 为长尾问题提供了一种极为简单却高度有效的解决方案,取得了最先进的 VidSGG 性能。
引用
@article{arxiv.2303.13209,
title = {Taking A Closer Look at Visual Relation: Unbiased Video Scene Graph Generation with Decoupled Label Learning},
author = {Wenqing Wang and Yawei Luo and Zhiqing Chen and Tao Jiang and Lei Chen and Yi Yang and Jun Xiao},
journal= {arXiv preprint arXiv:2303.13209},
year = {2023}
}