SUM:通过Mamba实现视觉注意力建模的显著性统一
计算机视觉与模式识别
2024-09-10 v2 人工智能
摘要
视觉注意力建模对于解释和优先处理视觉刺激至关重要,在市场营销、多媒体和机器人等应用中发挥着重要作用。传统的显著性预测模型,尤其是基于卷积神经网络(CNN)或Transformer的模型,通过利用大规模标注数据集取得了显著成功。然而,当前使用Transformer的最先进(SOTA)模型计算成本高昂。此外,通常需要为每种图像类型建立单独的模型,缺乏统一的方法。在本文中,我们提出了通过Mamba实现显著性统一(SUM),这是一种新颖的方法,它将Mamba的高效长程依赖建模能力与U-Net相结合,为多种图像类型提供了一个统一模型。通过使用新颖的条件视觉状态空间(C-VSS)模块,SUM能够动态适应各种图像类型,包括自然场景、网页和商业图像,确保了跨不同数据类型的通用适用性。我们在五个基准上的全面评估表明,SUM能够无缝适应不同的视觉特征,并持续优于现有模型。这些结果使SUM成为推进视觉注意力建模的多功能强大工具,为不同类型的视觉内容提供了普遍适用的鲁棒解决方案。
引用
@article{arxiv.2406.17815,
title = {SUM: Saliency Unification through Mamba for Visual Attention Modeling},
author = {Alireza Hosseini and Amirhossein Kazerouni and Saeed Akhavan and Michael Brudno and Babak Taati},
journal= {arXiv preprint arXiv:2406.17815},
year = {2024}
}
备注
Accepted at IEEE/CVF WACV 2025