中文

三重相关引导的标签补充用于无偏视频场景图生成

计算机视觉与模式识别 2023-08-01 v1

摘要

基于视频的场景图生成(VidSGG)是一种通过在动态图中识别视觉实体及其关系来表示视频内容的方法。由于训练数据中固有的偏置分布和标注缺失,当前 VidSGG 方法在被较少表示的谓词上表现不佳。在本文中,我们提出了一种显式解决方案来解决这一未被充分探索的问题,即补充本应出现在真值标注中的缺失谓词。我们的方法称为 Trico,旨在通过探索三种互补的时空相关性来补充缺失谓词。在这些相关性引导下,缺失标签可被有效补充,从而实现无偏的谓词预测。我们在最常用的 VidSGG 数据集(即 VidVRD 和 VidOR)上验证了 Trico 的有效性。大量实验表明 Trico 取得了最先进的性能,尤其在那些长尾谓词上。

关键词

引用

@article{arxiv.2307.16309,
  title  = {Triple Correlations-Guided Label Supplementation for Unbiased Video Scene Graph Generation},
  author = {Wenqing Wang and Kaifeng Gao and Yawei Luo and Tao Jiang and Fei Gao and Jian Shao and Jianwen Sun and Jun Xiao},
  journal= {arXiv preprint arXiv:2307.16309},
  year   = {2023}
}