视觉常识 R-CNN
计算机视觉与模式识别
2020-04-28 v3
摘要
我们提出一种新颖的无监督特征表示学习方法——视觉常识基于区域的卷积神经网络(VC R-CNN),以作为用于 captioning 和 VQA 等高层任务的改进视觉区域编码器。给定图像中一组检测到的对象区域(例如使用 Faster R-CNN),像任何其他无监督特征学习方法(例如 word2vec)一样,VC R-CNN 的代理训练目标是预测一个区域的上下文对象。然而,它们有根本不同:VC R-CNN 的预测通过使用因果干预:P(Y|do(X)),而其他方法通过使用常规似然:P(Y|X)。这也是 VC R-CNN 能学习“合乎情理”的知识(如椅子可被坐)而非仅仅是“常见”共现(如观察到桌子则椅子可能存在)的核心原因。我们广泛地将 VC R-CNN 特征应用于三种流行任务的主流模型中:图像 captioning、VQA 和 VCR,并观察到跨任务的持续性能提升,实现了许多新的 SOTA。代码与特征见 https://github.com/Wangt-CN/VC-R-CNN。
引用
@article{arxiv.2002.12204,
title = {Visual Commonsense R-CNN},
author = {Tan Wang and Jianqiang Huang and Hanwang Zhang and Qianru Sun},
journal= {arXiv preprint arXiv:2002.12204},
year = {2020}
}
备注
Accepted by CVPR 2020