用于无偏场景图生成的堆叠混合注意力与组协同学习
计算机视觉与模式识别
2022-04-05 v2 人工智能
摘要
场景图生成(SGG)通常遵循常规的编码器-解码器流程,旨在先编码给定图像内的视觉内容,再将其解析为紧凑的摘要图。现有SGG方法通常不仅忽视视觉与语言之间不充分的模态融合,还因有偏的关系预测而无法提供信息丰富的谓词,导致SGG远未实用。为此,本文首先提出一种新颖的堆叠混合注意力(Stacked Hybrid-Attention)网络作为编码器,促进模态内精炼与模态间交互。接着我们设计一种创新的组协同学习(Group Collaborative Learning)策略来优化解码器。特别地,基于单一分类器在极度不平衡数据集上识别能力有限的观察,我们首先部署一组擅长区分不同类别子集的分类器,再从两方面协同优化它们以促进无偏SGG。在VG和GQA数据集上的实验表明,我们不仅在无偏指标上确立了新的SOTA,相较两个基线性能近乎翻倍。
引用
@article{arxiv.2203.09811,
title = {Stacked Hybrid-Attention and Group Collaborative Learning for Unbiased Scene Graph Generation},
author = {Xingning Dong and Tian Gan and Xuemeng Song and Jianlong Wu and Yuan Cheng and Liqiang Nie},
journal= {arXiv preprint arXiv:2203.09811},
year = {2022}
}
备注
Accepted by CVPR 2022, the code is available at https://github.com/dongxingning/SHA-GCL-for-SGG