MaskAttn-UNet:基于掩码注意力的通用低分辨率图像分割框架
计算机视觉与模式识别
2025-05-09 v2 机器学习
图像与视频处理
摘要
低分辨率图像分割在机器人、增强现实和大规模场景理解等实际应用中至关重要,由于计算资源限制,往往无法获得高分辨率数据。为此,我们提出了MaskAttn-UNet,一种通过掩码注意力机制增强传统U-Net架构的新型分割框架。该模型有选择地强调重要区域,抑制无关背景,从而提高低分辨率输入在杂乱复杂场景中的分割精度。与常规U-Net变体不同,MaskAttn-UNet有效平衡了局部特征提取与更广阔的上下文感知,特别适用于低分辨率输入。我们在三个基准数据集上对方法进行评估,输入图像缩放至128x128,结果在语义、实例和全景分割任务上均表现出竞争性能。我们的实验表明,MaskAttn-UNet在计算成本显著低于基于Transformer的模型的情况下,实现了与SOTA方法相当的精度,为资源受限场景下的低分辨率分割提供了一种高效可扩展的解决方案。
引用
@article{arxiv.2503.10686,
title = {MaskAttn-UNet: A Mask Attention-Driven Framework for Universal Low-Resolution Image Segmentation},
author = {Anzhe Cheng and Chenzhong Yin and Yu Chang and Heng Ping and Shixuan Li and Shahin Nazarian and Paul Bogdan},
journal= {arXiv preprint arXiv:2503.10686},
year = {2025}
}