从有偏训练中实现无偏场景图生成
计算机视觉与模式识别
2025-10-28 v4 机器学习
摘要
当今的场景图生成(SGG)任务仍远未实用,主要由于严重的训练偏差,例如将多样的“human walk on / sit on / lay on beach”坍缩为“human on beach”。给定这样的SGG,视觉问答(VQA)等下游任务几乎无法推断出比仅仅一袋物体更好的场景结构。然而,SGG中的去偏并非易事,因为传统的去偏方法无法区分好偏差与坏偏差,例如好的上下文先验(如“person read book”而非“eat”)与坏的长尾偏差(如“near”主导“behind / in front of”)。在本文中,我们提出了一种基于因果推断而非传统似然的新型SGG框架。我们首先为SGG构建因果图,并用该图进行传统的偏置训练。然后,我们提出从训练好的图中抽取反事实因果以推断应被去除的坏偏差效应。特别地,我们使用总直接效应(TDE)作为所提出的无偏SGG的最终谓词分数。注意,我们的框架与任何SGG模型无关,因此可广泛应用于寻求无偏预测的学界。通过在SGG基准Visual Genome和若干流行模型上使用所提出的场景图诊断工具包,我们观察到相较先前最先进方法的显著提升。
引用
@article{arxiv.2002.11949,
title = {Unbiased Scene Graph Generation from Biased Training},
author = {Kaihua Tang and Yulei Niu and Jianqiang Huang and Jiaxin Shi and Hanwang Zhang},
journal= {arXiv preprint arXiv:2002.11949},
year = {2025}
}
备注
This paper is accepted by CVPR 2020. The code is publicly available on GitHub: https://github.com/KaihuaTang/Scene-Graph-Benchmark.pytorch