面向低延迟语义分割的跨层注意力特征上采样
计算机视觉与模式识别
2026-01-06 v1
摘要
语义分割是计算机视觉中的基础问题,要求高分辨率特征图以进行密集预测。当前基于坐标引导的低分辨率特征插值方法(如双线性插值)产生粗糙的高分辨率特征,存在特征错位和上下文信息不足的问题。此外,向高分辨率特征丰富语义信息的计算负担较大,使得实现低延迟推理具有挑战性。我们提出一种新颖的引导注意力插值(GAI)方法,通过语义特征自适应地对细粒度高分辨率特征进行插值以解决上述问题。引导注意力插值从不同分辨率的特征中确定像素的空间关系和语义关系,然后利用这些关系对具有丰富语义的高分辨率特征进行插值。GAI 可与任何深度卷积网络集成,以实现高效语义分割。在实验中,基于 GAI 的语义分割网络(即 GAIN)在 Cityscapes 上以 78.8 mIoU、22.3 FPS 实现,在 CamVid 上以 80.6 mIoU、64.5 FPS 实现,这是低延迟语义分割的新型最佳结果。代码和模型已提供:https://github.com/hustvl/simpleseg。
引用
@article{arxiv.2601.01167,
title = {Cross-Layer Attentive Feature Upsampling for Low-latency Semantic Segmentation},
author = {Tianheng Cheng and Xinggang Wang and Junchao Liao and Wenyu Liu},
journal= {arXiv preprint arXiv:2601.01167},
year = {2026}
}