AdaRing:基于跨层张量环分解实现超轻量视觉语言适配
计算机视觉与模式识别
2025-08-21 v2 人工智能
摘要
基于适配器的微调在为大规模预训练视觉语言模型(VLM)适应广泛下游任务方面取得了显著关注。在此范式下,仅微调插入的适配器,而无需训练原始VLM骨架。现有工作通过将适配器集成到VLMs的每一层来扩展适配器规模,但面临两个主要局限性:1) 因忽视跨层冗余而导致压缩率有限;2) 跨同质适配器之间表示容量有限。本文提出一种新型视觉语言微调框架,基于跨层张量环分解(TRD)实现适配器集成与协作,称为AdaRing,实现了VLMs在各种任务上的超轻参数高效适配。为消除适配器在不同层之间存在的高冗余, 我们在张量层面利用低秩性将适配器建模为层共享张量核和层特定切片。此外,依据通用性感知微调原则,各种秩驱动的适配器协同工作,以处理需要不同表示的任务。我们的实验表明,所提出的AdaRing在保持卓越性能的同时,将平均训练参数减少90%。
引用
@article{arxiv.2508.11870,
title = {AdaRing: Towards Ultra-Light Vision-Language Adaptation via Cross-Layer Tensor Ring Decomposition},
author = {Ying Huang and Yuanbin Man and Wenqi Jia and Zhengzhong Tu and Junzhou Huang and Miao Yin},
journal= {arXiv preprint arXiv:2508.11870},
year = {2025}
}