中文

用于无偏场景图生成的双分支混合学习网络

计算机视觉与模式识别 2022-07-19 v1

摘要

当前场景图生成(SGG)的研究集中于解决生成长尾无偏场景图的问题。然而,大多数去偏方法在整个训练过程中过度强调尾部谓词而低估头部谓词,从而破坏了头部谓词特征的表示能力。此外,这些来自头部谓词的受损特征损害了尾部谓词的学习。事实上,尾部谓词的推断严重依赖于从头部谓词学习到的通用模式,例如“standing on”依赖于“on”。因此,这些去偏SGG方法既无法在尾部谓词上取得优异性能,也无法在头部谓词上表现令人满意。为解决此问题,我们提出一种双分支混合学习网络(DHL),以兼顾头部与尾部谓词进行SGG,包括粗粒度学习分支(CLB)和细粒度学习分支(FLB)。具体而言,CLB负责学习头部谓词的专业且鲁棒的特征,而FLB旨在预测信息丰富的尾部谓词。此外,DHL配备分支课程调度(BCS)以使两个分支良好协作。实验表明,我们的方法在VG和GQA数据集上取得了新的最先进性能,并在尾部与头部谓词性能间取得权衡。此外,在两个下游任务(即图像字幕和句子到图检索)上的大量实验进一步验证了方法的泛化性与实用性。

关键词

引用

@article{arxiv.2207.07913,
  title  = {Dual-branch Hybrid Learning Network for Unbiased Scene Graph Generation},
  author = {Chaofan Zheng and Lianli Gao and Xinyu Lyu and Pengpeng Zeng and Abdulmotaleb El Saddik and Heng Tao Shen},
  journal= {arXiv preprint arXiv:2207.07913},
  year   = {2022}
}