中文

用于无偏场景图生成的集成谓词解码

计算机视觉与模式识别 2024-08-27 v1

摘要

场景图生成 (SGG) 旨在生成能够准确捕获给定场景语义信息的全面图表示。然而,SGG 模型在预测更细粒度谓词时的性能受到显著谓词偏差的阻碍。根据现有研究,训练数据中谓词的长尾分布导致了有偏的场景图。然而,谓词类别之间的语义重叠使得谓词预测变得困难,并且语义相似的谓词在样本量上存在显著差异,使得谓词预测更加困难。因此,对模型的判别能力提出了更高的要求。为了解决这个问题,本文提出了集成谓词解码 (EPD),它采用多个解码器来实现无偏场景图生成。在低频谓词上训练的两个辅助解码器被用于提高模型的判别能力。我们在 VG 上进行了大量实验,实验结果表明 EPD 增强了模型对谓词的表示能力。此外,我们发现与以往的无偏 SGG 方法相比,我们的方法确保了对更频繁谓词具有相对更优的预测能力。

关键词

引用

@article{arxiv.2408.14187,
  title  = {Ensemble Predicate Decoding for Unbiased Scene Graph Generation},
  author = {Jiasong Feng and Lichun Wang and Hongbo Xu and Kai Xu and Baocai Yin},
  journal= {arXiv preprint arXiv:2408.14187},
  year   = {2024}
}