面向动态场景图生成的局部-全局信息交互去偏方法
计算机视觉与模式识别
2023-09-26 v2
摘要
动态场景图生成(DynSGG)任务旨在为给定视频生成场景图,其涉及对视频中时空信息的建模。然而,由于数据集中样本的长尾分布,以往的 DynSGG 模型无法预测尾部谓词。我们认为这一现象源于以往方法仅关注局部时空信息而忽略了多帧之间的一致性。为解决该问题,我们提出了一种基于多任务学习的新型 DynSGG 模型 DynSGG-MTL,其引入了局部交互信息与全局人-动作交互信息。物体与帧特征之间的交互使模型更充分地理解单幅图像的视觉上下文。长时域人体动作监督模型生成符合全局约束的多个场景图,并避免模型无法学习尾部谓词。在 Action Genome 数据集上的大量实验证明了我们所提框架的有效性,其不仅提升了动态场景图生成性能,还缓解了长尾问题。
引用
@article{arxiv.2308.05274,
title = {Local-Global Information Interaction Debiasing for Dynamic Scene Graph Generation},
author = {Xinyu Lyu and Jingwei Liu and Yuyu Guo and Lianli Gao},
journal= {arXiv preprint arXiv:2308.05274},
year = {2023}
}
备注
The author has withdrawn this paper due to a critical definitional error in multi-task learning for dynamic SGG debiasing. This error aligned with the definition of dynamic SGG tasks, resulting in an unfair comparison with state-of-the-art (SOTA) methods, which in turn, hindered the ability to evaluate the paper's contributions