中文

学习视觉常识以增强场景图生成的鲁棒性

计算机视觉与模式识别 2020-07-21 v2 机器学习

摘要

场景图生成模型通过物体与谓词识别来理解场景,但由于真实环境中感知的困难而容易出错。感知错误常导致输出场景图中出现不符合现实世界规则与模式的荒谬组合,而这类错误可利用常识知识加以纠正。我们提出了第一种从数据中自动获取可供性与直观物理等视觉常识的方法,并用其提升场景理解的鲁棒性。为此,我们扩展 Transformer 模型以融入场景图结构,并在场景图语料上训练我们的全局-局部注意力 Transformer (Global-Local Attention Transformer)。训练完成后,我们的模型可应用于任意场景图生成模型并纠正其明显错误,从而得到语义上更合理的场景图。通过大量实验,我们表明我们的模型比任何替代方案都更好地学习了常识,并提升了最先进场景图生成方法的准确性。

关键词

引用

@article{arxiv.2006.09623,
  title  = {Learning Visual Commonsense for Robust Scene Graph Generation},
  author = {Alireza Zareian and Zhecan Wang and Haoxuan You and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:2006.09623},
  year   = {2020}
}

备注

To be presented at ECCV 2020