中文

用于场景图解析的图形对比损失

计算机视觉与模式识别 2019-08-20 v5

摘要

多数场景图解析器采用两阶段流水线检测视觉关系:第一阶段检测实体,第二阶段利用 softmax 分布预测每对实体的谓词。我们发现此类仅以谓词类交叉熵损失训练的流水线易犯两类常见错误。其一为实体实例混淆,即模型混淆同一类型实体的多个实例(如多个杯子)。其二为邻近关系歧义,当多个主-谓-宾三元组以相同谓词紧密邻近出现、模型难以推断正确主宾配对(如错配乐手与其乐器)时产生。我们提出一组对比损失形式,专门针对场景图解析中的此类错误,统称为图形对比损失。这些损失通过针对各类混淆的间隔约束显式迫使模型区分相关与不相关实例。我们进一步使用上述流水线构建称为 RelDN 的关系检测器以证明所提损失的有效性。我们的模型在测试集上以 4.7%(相对 16.5%)优于 OpenImages 关系检测挑战赛的获胜方法。在 Visual Genome 与 Visual Relationship Detection 数据集上也展示了相较最佳已有方法的改进结果。

关键词

引用

@article{arxiv.1903.02728,
  title  = {Graphical Contrastive Losses for Scene Graph Parsing},
  author = {Ji Zhang and Kevin J. Shih and Ahmed Elgammal and Andrew Tao and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:1903.02728},
  year   = {2019}
}