中文

面向视频场景图生成的元时空去偏方法

计算机视觉与模式识别 2022-08-02 v2

摘要

视频场景图生成(VidSGG)旨在将视频内容解析为场景图,这涉及对视频中时空上下文信息进行建模。然而,由于数据集中的训练数据呈长尾分布,现有 VidSGG 模型的泛化性能会受到时空条件偏差问题的影响。在本工作中,我们从元学习的角度出发,提出一种新颖的元视频场景图生成(MVSGG)框架来解决此类偏差问题。具体而言,为处理多种类型的时空条件偏差,我们的框架首先从训练数据构建支持集和一组查询集,其中每个查询集的数据分布相对于某种条件偏差而言与支持集不同。然后,通过执行一种新颖的元训练与测试过程,优化模型使其在支持集上训练后于这些查询集上获得良好的测试性能,我们的框架能有效引导模型学会良好地泛化以抵抗偏差。大量实验证明了我们所提框架的有效性。

关键词

引用

@article{arxiv.2207.11441,
  title  = {Meta Spatio-Temporal Debiasing for Video Scene Graph Generation},
  author = {Li Xu and Haoxuan Qu and Jason Kuen and Jiuxiang Gu and Jun Liu},
  journal= {arXiv preprint arXiv:2207.11441},
  year   = {2022}
}

备注

Accepted by ECCV 2022