基于丰富且公平语义提取的无偏场景图生成
计算机视觉与模式识别
2020-02-04 v1
摘要
提取图像中视觉场景的图表示是计算机视觉中一项具有挑战性的任务。尽管过去十年中场景图生成取得了令人鼓舞的进展,我们惊讶地发现现有方法的性能在很大程度上受限于强偏差,这些偏差主要源于 (1) 无意识地假设具有某些语义属性(如对称性)的关系,以及 (2) 不同关系上标注的不平衡。为缓解这些偏差的负面影响,我们提出了一种新颖且简单的架构,称为丰富且公平语义提取网络(简称 RiFa),不仅捕获关系的丰富语义属性,还公平地预测具有不同规模标注的关系。RiFa 使用伪孪生网络分别嵌入主体和客体,以区分其语义差异并同时保留其底层语义属性。然后,它基于在特定上下文区域内的实体的视觉和语义特征进一步预测主体-客体关系,并对那些标注较少的关系的预测进行公平排序。在流行的 Visual Genome 数据集上的实验表明,RiFa 在场景图任务的若干挑战性设定下达到了最先进的性能。特别是,它在捕获关系不同语义属性方面表现显著更好,并获得了最佳的整体逐关系性能。
引用
@article{arxiv.2002.00176,
title = {Unbiased Scene Graph Generation via Rich and Fair Semantic Extraction},
author = {Bin Wen and Jie Luo and Xianglong Liu and Lei Huang},
journal= {arXiv preprint arXiv:2002.00176},
year = {2020}
}
备注
9 pages, 5 figures