中文

面向无偏和稳健时空场景图生成与预测

计算机视觉与模式识别 2025-03-26 v2

摘要

时空场景图(STSG)通过建模对象及其随时间演化的关系,提供了动态场景的简洁且富有表达力的表示。然而,现实中的视觉关系常呈现长尾分布,导致面向视频场景图生成(VidSGg)和场景图预测(SGA)的现有方法产生偏置。为此,我们提出一种名为ImparTail的新型训练框架,利用损失掩码和课程学习以缓解场景图生成和预测中的偏置。不同于先前通过添加额外架构组件来学习无偏估计器的方法,我们提出一种无偏训练目标,减少头部类别在学习过程中的支配优势,聚焦于 underrepresented尾部关系。我们的课程驱动的掩码生成策略进一步使模型能够随时间自适应调整其偏置缓解策略,从而实现更均衡和稳健的估计。为全面评估在各种分布迁移下的性能,我们还引入两种新任务:稳健时空场景图生成和稳健场景图预测,为评估STSG模型的韧性提供了具有挑战性的基准。大量实验在Action Genome数据集上表明,我们的方法在偏置性和韧性方面优于现有基线。

关键词

引用

@article{arxiv.2411.13059,
  title  = {Towards Unbiased and Robust Spatio-Temporal Scene Graph Generation and Anticipation},
  author = {Rohith Peddi and Saurabh and Ayush Abhay Shrivastava and Parag Singla and Vibhav Gogate},
  journal= {arXiv preprint arXiv:2411.13059},
  year   = {2025}
}

备注

CVPR 2025