NAS-LoRA:用于可搜索适应性的视觉基础模型参数高效微调方法
计算机视觉与模式识别
2025-12-04 v1 人工智能
计算与语言
摘要
Segment Anything Model (SAM) 已成为图像分割领域的强大视觉基础模型。然而,将 SAM 适配到医学影像和农业影像等特定下游任务仍面临重大挑战。为此,Low-Rank Adaptation (LoRA) 及其变体广泛用于增强 SAM 在各类领域的适应性能。尽管取得进展,但一个关键问题随之而来:我们能否将归纳偏置引入模型中?这尤其相关,因为 SAM 中 Transformer 编码器天然缺乏图像图像块的空间先验,这可能阻碍其获取高阶语义信息的能力。本文提出了 NAS-LoRA,一种新的参数高效微调 (PEFT) 方法,旨�弥合预训练 SAM 与特定领域之间的语义鸿沟。具体而言,NAS-LoRA 在 LoRA 的编码器与解码器组件之间引入轻量级神经网络架构搜索 (NAS) 块,以动态优化集成到权重更新中的先验知识。此外,我们提出了阶段性优化策略,帮助 ViT 编码器在权重更新与架构调整之间取得平衡,促进高阶语义信息的渐进学习。各种实验表明,我们的 NAS-LoRA 在现有 PEFT 方法基础上取得改进,同时以 24.14% 的训练成本降低,却不增加推理成本,凸显了 NAS 在提升视觉基础模型 PEFT 方法中的潜力。
引用
@article{arxiv.2512.03499,
title = {NAS-LoRA: Empowering Parameter-Efficient Fine-Tuning for Visual Foundation Models with Searchable Adaptation},
author = {Renqi Chen and Haoyang Su and Shixiang Tang},
journal= {arXiv preprint arXiv:2512.03499},
year = {2025}
}