基于视觉与语义双向去偏的无偏视频场景图生成
计算机视觉与模式识别
2025-04-08 v2 多媒体
摘要
视频场景图生成(VidSGG)旨在通过顺序分析视频帧并整合视觉与语义信息来捕捉实体之间动态关系。然而,VidSGG面临显著偏差,这些偏差会扭曲预测结果。为缓解这些偏差,本文提出了一种视觉语义感知(VIsual and Semantic Awareness, VISA)框架,用于实现无偏VidSGG。VISA通过内存增强的时序集成来处理视觉偏差,从而增强物体表征,同时通过迭代整合源自三元组关系的全面语义信息来减少语义偏差。这种视觉-语义双向去偏方法导致对复杂场景动态的更无偏表征。大量实验表明本方法有效,其中VISA在现有无偏VidSGG方法之上显著优于 (+13.1% 在 mR@20 和 mR@50 上的改进,针对 SGCLS 任务下的 Semi Constraint 情况)。
引用
@article{arxiv.2503.00548,
title = {Unbiased Video Scene Graph Generation via Visual and Semantic Dual Debiasing},
author = {Yanjun Li and Zhaoyang Li and Honghui Chen and Lizhi Xu},
journal= {arXiv preprint arXiv:2503.00548},
year = {2025}
}
备注
17 pages, 8 figures, CVPR 2025 (poster)