ATV-Net:基于自适应三视图网络的动态特征融合
计算机视觉与模式识别
2026-05-26 v1
摘要
最近的语义分割研究越来越倾向于采用更强的上下文建模、密集注意力和基于Transformer的架构。尽管这些模型取得了令人印象深刻的性能,但经典的基于CNN的分割管道仍然吸引人,因为它们简单、高效且易于实现。本文重新审视了一个实用问题:仅通过修改分割头,基于ResNet的分割模型可以获得多大的改进?我们提出了ATV-Net,即自适应三视图网络(Adaptive Triple-View Network),通过三种简单而互补的感受野视图来强化ResNet-101主干网络。微观视图捕获点级语义响应,局部视图建模邻域结构和物体边界,侦察视图提供扩大的上下文线索。与使用固定权重融合这些视图不同,ATV-Net引入了自适应决策门(Adaptive Decision Gate),根据输入场景特征动态选择感受野响应。进一步应用紧凑的全局协调层,以提高空间和语义一致性。在Cityscapes验证集上的实验表明,ATV-Net实现了80.31%的mIoU。这一结果表明,经典的基于CNN的分割方法仍然远未过时:仅通过简单的文件感受野视图和自适应融合,基于ResNet的管道即可达到具竞争力的准确度,无需依赖Transformer式的全局注意力或过于复杂的上下文模块。
引用
@article{arxiv.2605.25803,
title = {ATV-Net: Adaptive Triple-View Network with Dynamic Feature Fusion},
author = {Hsin-Jui Pan and Sheng-Wei Chan and Meng-Qian Li and Chun-Po Shen},
journal= {arXiv preprint arXiv:2605.25803},
year = {2026}
}
备注
Code will be released soon