中文

NAS-LoRA:通过可搜索适配赋能视觉基础模型的参数高效微调

计算机视觉与模式识别 2025-12-04 v1

摘要

Segment Anything Model(SAM)已成为图像分割的强大视觉基础模型。然而,将 SAM 适配到特定下游任务(如医学和农业成像)仍然是一个重大挑战。为解决这一问题,低秩适配(LoRA)及其变体已被广泛用于增强 SAM 在多样化领域的适配性能。尽管取得了进展,一个关键问题浮现:我们能否将归纳偏置融入模型?这尤其相关,因为 SAM 中的 Transformer 编码器本质上缺乏图像块内的空间先验,可能阻碍高层语义信息的获取。在本文中,我们提出 NAS-LoRA,一种新的参数高效微调(PEFT)方法,旨在弥合预训练 SAM 与专门领域之间的语义鸿沟。具体而言,NAS-LoRA 在 LoRA 的编码器与解码器组件之间嵌入一个轻量级神经网络架构搜索(NAS)模块,以动态优化权重更新中整合的先验知识。此外,我们提出分阶段优化策略,帮助 ViT 编码器在权重更新与架构调整之间取得平衡,促进高层语义信息的渐进学习。多种实验表明,NAS-LoRA 在不增加推理成本的情况下将训练成本降低了 24.14%,同时提升了现有 PEFT 方法的性能,凸显了 NAS 在增强视觉基础模型 PEFT 方面的潜力。

关键词

引用

@article{arxiv.2512.03500,
  title  = {EEA: Exploration-Exploitation Agent for Long Video Understanding},
  author = {Te Yang and Xiangyu Zhu and Bo Wang and Quan Chen and Peng Jiang and Zhen Lei},
  journal= {arXiv preprint arXiv:2512.03500},
  year   = {2025}
}