AdaVFM:基于 LLM 引导执行的边缘智能自适应视觉基础模型
计算机视觉与模式识别
2026-05-05 v2 机器学习
摘要
语言对齐的视觉基础模型为常驻情境 AI 提供了通用的视觉理解能力,但严格的延迟和功耗约束阻碍了其在边缘设备上的部署。我们提出了 AdaVFM,这是一个用于语言对齐 VFM 高效设备端推理的自适应框架,可根据场景上下文和任务复杂度动态调整计算量。我们的核心洞察是,在视觉应用中模型尺寸缩减对性能的影响具有任务依赖性,这促使了运行时自适应执行策略的提出。AdaVFM 将神经架构搜索(NAS)集成到语言对齐的 VFM 主干网络中,以在运行时实现轻量级子网执行。部署在云端的多模态大语言模型(LLM)通过上下文感知代理实现运行时控制。这种协同作用在保持高精度的同时,实现了在多种条件下的高效模型自适应。在零样本分类和开放词汇分割上的大量实验表明,AdaVFM 实现了 SOTA 的精度-效率权衡,在 IN1K 上的 acc@1 和 ADE20K 上的 mIoU 分别比同等 VFM 尺寸的最佳模型高出 和 。对于精度相似的模型,AdaVFM 进一步将平均 FLOPs 最多减少了 。
引用
@article{arxiv.2604.15622,
title = {AdaVFM: Adaptive Vision Foundation Models for Edge Intelligence via LLM-Guided Execution},
author = {Yiwei Zhao and Yi Zheng and Huapeng Su and Jieyu Lin and Stefano Ambrogio and Cijo Jose and Michael Ramamonjisoa and Patrick Labatut and Barbara De Salvo and Chiao Liu and Phillip B. Gibbons and Ziyun Li},
journal= {arXiv preprint arXiv:2604.15622},
year = {2026}
}