中文

HyCTAS:用于实时图像分割的多目标混合卷积-Transformer 架构搜索

计算机视觉与模式识别 2025-11-11 v3

摘要

实时图像分割要求架构在严格的延迟和内存预算下,既能保留精细的空间细节,又能捕获全局上下文。图像分割是计算机视觉中最基本的问题之一,因其在图像理解和自动驾驶中的广泛应用而备受关注。然而,设计有效且高效的分割神经架构是一个劳动密集型的过程,可能需要人类专家进行大量试验。在本文中,我们通过利用架构搜索,解决了将多头自注意力高效集成到高分辨率表示 CNN 中的挑战。由于维持高分辨率在内存方面的昂贵开销,手动用多头自注意力替换卷积层并非易事。相比之下,我们开发了一种多目标多分支超网络方法,该方法不仅充分利用了高分辨率特征的优势,还找到了放置多头自注意力模块的合适位置。我们的搜索算法针对多个目标(例如延迟和 mIoU)进行优化,能够在单次搜索中找到具有任意分支数的近似 Pareto 前沿上的架构。我们进一步提出了一系列通过混合卷积-Transformer 架构搜索(HyCTAS)方法生成的模型,该方法在不同分辨率的分支之间搜索轻量级卷积层和内存高效自注意力层的最佳混合组合,并在高分辨率下融合它们以兼顾效率与有效性。在 Cityscapes、ADE20K 和 COCO 上,HyCTAS 在没有 ImageNet 预训练的情况下发现了具有竞争力的实时模型,提供了出色的准确率和延迟权衡。代码和模型可在 https://github.com/MarvinYu1995/HyCTAS 获取。

关键词

引用

@article{arxiv.2403.10413,
  title  = {HyCTAS: Multi-Objective Hybrid Convolution-Transformer Architecture Search for Real-Time Image Segmentation},
  author = {Hongyuan Yu and Cheng Wan and Xiyang Dai and Mengchen Liu and Dongdong Chen and Bin Xiao and Yan Huang and Yuan Lu and Liang Wang},
  journal= {arXiv preprint arXiv:2403.10413},
  year   = {2025}
}

备注

24 pages, 5 figures, published at Neurocomputing