中文

像人一样偏置:一种面向场景图生成的认知偏置框架

计算机视觉与模式识别 2022-03-18 v1

摘要

场景图生成是一项复杂任务,因为不存在特定的识别模式(例如,“looking at”与“near”在视觉上无显著差异,而“near”可出现在形态不同的实体之间)。因此,一些场景图生成方法受易变的视觉特征与琐碎的数据集标注影响,陷入了最频繁关系预测的困境。为此,近期工作强调“无偏”方法以平衡预测,从而生成信息更丰富的场景图。然而,人类对于众多物体间关系的快速准确判断应归因于“偏置”(即经验与语言知识)而非纯视觉。为增强模型能力,受“认知偏置”机制启发,我们提出一种新颖的三范式框架,模拟人类如何将标签语言特征作为基于视觉表示的引导,以更好地挖掘隐藏关系模式并缓解噪声视觉传播。我们的框架对任意场景图模型均为模型无关。综合实验证明,我们的框架以最小参数增量在多项指标上优于基线模块,并在 Visual Genome 数据集上取得新的 SOTA 性能。

关键词

引用

@article{arxiv.2203.09160,
  title  = {Biasing Like Human: A Cognitive Bias Framework for Scene Graph Generation},
  author = {Xiaoguang Chang and Teng Wang and Changyin Sun and Wenzhe Cai},
  journal= {arXiv preprint arXiv:2203.09160},
  year   = {2022}
}