用于像素级预测的条件核概率图注意力网络
计算机视觉与模式识别
2022-03-15 v2 图像与视频处理
摘要
通过卷积神经网络深度学习的多尺度表示已在各类像素级预测问题中展现出巨大重要性。本文提出一种新方法,在结构化多尺度特征学习与融合这一基本方面推进了像素级预测的最优水平。与以往工作直接考虑从主干 CNN 架构内部层获取的多尺度特征图,并简单地以加权平均或拼接融合特征不同,我们提出一种基于新颖的注意力门控条件随机场(AG-CRFs)模型的概率图注意力网络结构,以原则性方式学习与融合多尺度表示。为进一步提升网络结构的学习能力,我们提出在深度概率框架内利用特征依赖的条件核。我们在四个公开数据集(即 BSDS500、NYUD-V2、KITTI 和 Pascal-Context)以及三个兼具离散与连续标签的极具挑战性的像素级预测问题(即单目深度估计、物体轮廓预测和语义分割)上进行了大量实验。定量与定性结果证明了所提出的潜在 AG-CRF 模型以及具备特征条件核的整体概率图注意力网络在结构化特征学习与像素级预测中的有效性。
引用
@article{arxiv.2101.02843,
title = {Probabilistic Graph Attention Network with Conditional Kernels for Pixel-Wise Prediction},
author = {Dan Xu and Xavier Alameda-Pineda and Wanli Ouyang and Elisa Ricci and Xiaogang Wang and Nicu Sebe},
journal= {arXiv preprint arXiv:2101.02843},
year = {2022}
}
备注
Regular paper accepted at TPAMI 2020. arXiv admin note: text overlap with arXiv:1801.00524