利用谓词相似性的无偏场景图生成
计算机视觉与模式识别
2022-10-04 v1
摘要
场景图作为图像中物体间关系的图形化表示,在计算机视觉中被广泛应用。然而,由于长尾谓词分布导致的有偏训练,这些应用尚未达到实用的发展阶段。近年来,许多研究致力于解决该问题。相比之下,较少有工作将谓词相似性视为导致有偏预测的独特数据集特征。由于该特征,低频谓词(如 parked on、covered in)容易被误分类为密切相关的频繁谓词(如 on、in)。利用谓词相似性,我们提出了一种新的分类方案,将过程分支到多个针对相似谓词组的细粒度分类器。这些分类器旨在细致地捕捉相似谓词之间的差异。我们还引入了迁移学习的思想,以增强那些缺乏足够训练样本来学习描述性表示的谓词的特征。在 Visual Genome 数据集上的大量实验结果表明,我们的方法与现有去偏方法相结合,在具有挑战性的 SGCls/SGDet 任务中大幅提升了尾部谓词的性能。尽管如此,所提方法的整体性能尚未达到当前最先进水平(SOTA),因此进一步分析仍有必要作为未来工作。
引用
@article{arxiv.2210.00920,
title = {Unbiased Scene Graph Generation using Predicate Similarities},
author = {Misaki Ohashi and Yusuke Matsui},
journal= {arXiv preprint arXiv:2210.00920},
year = {2022}
}