双域表示对齐:通过几何感知架构搜索桥接2D与3D视觉
计算机视觉与模式识别
2026-03-23 v1 人工智能
摘要
现代计算机视觉需要在预测准确性与实际效率之间取得平衡,但大型视觉模型(LVMs)的高推理成本限制了在资源受限的边缘设备上的部署。虽然演化神经架构搜索(ENAS)适用于多目标优化,但其实际应用受到两个问题的制约:候选评估成本高昂和子网络排名不一致。为此,我们提出EvoNAS,一个高效的分布式多目标演化架构搜索框架。我们构建一种混合超级网络,集成视觉状态空间(Vision State Space)和视觉Transformer(ViT)模块(VSS-ViT),并采用跨架构双域知识蒸馏(CA-DDKD)策略进行优化。通过将VSS模块的计算效率与ViT模块的语义表达能力耦合,CA-DDKD提高了共享超级网络的表征能力,增强了排名一致性,使演化期间的适应度估计可靠且无需额外微调。为降低大规模验证成本,我们进一步引入基于GPU资源池和异步调度的分布式多模型并行评估(DMMPE)框架。与传统数据并行评估相比,DMMPE通过并发多GPU、多模型执行,提高了效率70%以上。在COCO、ADE20K、KITTI和NYU-Depth v2等数据集上的实验表明,搜索得到的架构(称为EvoNets)在准确率与效率之间始终实现帕累托最优权衡。与代表性的CNN、ViT和Mamba模型相比,EvoNets在严格的计算预算下实现更低的推理延迟和更高的吞吐量,同时在下游任务(如新视角合成)上保持强大的泛化能力。代码已发布于https://github.com/EMI-Group/evonas
关键词
引用
@article{arxiv.2603.19563,
title = {Dual-Domain Representation Alignment: Bridging 2D and 3D Vision via Geometry-Aware Architecture Search},
author = {Haoyu Zhang and Zhihao Yu and Rui Wang and Yaochu Jin and Qiqi Liu and Ran Cheng},
journal= {arXiv preprint arXiv:2603.19563},
year = {2026}
}