视频中的无偏场景图生成
计算机视觉与模式识别
2023-07-03 v3
摘要
从视频中进行动态场景图生成(SGG)的任务由于场景的固有动态性、模型预测的时间波动以及视觉关系的长尾分布(此外还有基于图像的SGG中已存在的挑战)而变得复杂且困难。现有的动态SGG方法主要侧重于使用复杂架构捕获时空上下文,而未解决上述挑战,尤其是关系的长尾分布。这常常导致生成有偏的场景图。为应对这些挑战,我们提出了一种称为TEMPURA的新框架:用于无偏动态SGG的时间一致性与记忆原型引导的不确定性衰减(TEmporal consistency and Memory Prototype guided UnceRtainty Attenuation)。TEMPURA通过基于transformer的序列建模采用对象级时间一致性,学习使用记忆引导训练合成无偏关系表示,并使用高斯混合模型(GMM)衰减视觉关系的预测不确定性。大量实验表明,我们的方法比现有方法取得了显著的性能提升(在某些情况下高达10%),突出了其在生成更无偏场景图中的优越性。
引用
@article{arxiv.2304.00733,
title = {Unbiased Scene Graph Generation in Videos},
author = {Sayak Nag and Kyle Min and Subarna Tripathi and Amit K. Roy Chowdhury},
journal= {arXiv preprint arXiv:2304.00733},
year = {2023}
}
备注
Published in IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2023