EVP:基于逆向多重注意力特征细化与正则化图文对齐的增强视觉感知
计算机视觉与模式识别
2023-12-15 v1
摘要
本工作提出了网络架构EVP(Enhanced Visual Perception,增强视觉感知)。EVP建立在先前工作VPD的基础之上,后者为将Stable Diffusion网络用于计算机视觉任务铺平了道路。我们提出了两项主要增强。首先,我们开发了逆向多重注意力特征细化(IMAFR)模块,通过聚合来自更高金字塔层的空间信息来增强特征学习能力。其次,我们提出了一种新颖的图文对齐模块,以改进Stable Diffusion骨干网络的特征提取。由此产生的架构适用于多种任务,我们在单图像深度估计(使用基于分类的bins的专用解码器)和指代分割(使用现成解码器)的背景下展示了其性能。在既有数据集上进行的综合实验表明,EVP在室内(NYU Depth v2,较VPD的RMSE提升11.8%)和室外(KITTI)环境的单图像深度估计,以及指代分割(RefCOCO,较ReLA的IoU提升2.53)中均取得了SOTA结果。代码和预训练模型已在 https://github.com/Lavreniuk/EVP 公开提供。
引用
@article{arxiv.2312.08548,
title = {EVP: Enhanced Visual Perception using Inverse Multi-Attentive Feature Refinement and Regularized Image-Text Alignment},
author = {Mykola Lavreniuk and Shariq Farooq Bhat and Matthias Müller and Peter Wonka},
journal= {arXiv preprint arXiv:2312.08548},
year = {2023}
}