用于增强空间上下文的潜在图注意力
计算机视觉与模式识别
2023-07-13 v2 人工智能
机器学习
摘要
图像中的全局上下文在图像到图像翻译问题中极具价值。传统的基于注意力和基于图的模型在很大程度上捕获了全局上下文,然而这些模型计算代价高昂。此外,现有方法仅限于学习图像上任意两点之间的成对语义关系。本文提出潜在图注意力(LGA),一种计算代价低(关于节点数呈线性)且稳定的模块化框架,用于将全局上下文融入现有架构,尤其使小规模架构性能接近大规模架构,从而使轻量架构对计算能力较低、能耗需求较低的边缘设备更为有用。LGA 使用局部连接图网络在空间上传播信息,从而有助于在任何两个空间 distant 点之间构建语义连贯的关系,同时考虑中间像素的影响。此外,图网络的深度可用于使上下文扩散程度适应目标数据集,从而能够显式控制所增加的计算成本。为增强 LGA 的学习机制,我们还引入了一种新颖的对比损失项,以极小的额外计算负载使 LGA 模块与原架构良好耦合。我们表明,引入 LGA 在三个具有挑战性的应用上提升了性能,即透明物体分割、去雾图像复原和光流估计。
引用
@article{arxiv.2307.04149,
title = {Latent Graph Attention for Enhanced Spatial Context},
author = {Ayush Singh and Yash Bhambhu and Himanshu Buckchash and Deepak K. Gupta and Dilip K. Prasad},
journal= {arXiv preprint arXiv:2307.04149},
year = {2023}
}
备注
20 pages, 7 figures