GeoStack:面向VLMs中准阿贝尔知识组成的框架
计算机视觉与模式识别
2026-05-08 v1
摘要
我们解决了视觉语言模型(VLMs)中知识组成的挑战,其中在多个领域或任务上积累专业知识通常会导致灾难性遗忘。我们引入GeoStack(几何堆叠),一个模块化框架,允许独立训练的领域专家被组成为统一模型。通过在适配器流形上施加几何和结构约束,GeoStack确保了基础模型的基本知识得到保留。此外,我们数学证明了一种权重折叠特性,可实现常数时间推断复杂度( ), regardless of the number of integrated experts。实验结果表明,在多域适应和类别增量学习中,GeoStack提供了一种高效的长期知识组成机制,显著缓解了灾难性遗忘。代码可在 https://github.com/QuantitativeImagingLaboratory/GeoStack 获取。
引用
@article{arxiv.2605.06477,
title = {GeoStack: A Framework for Quasi-Abelian Knowledge Composition in VLMs},
author = {Pranav Mantini and Shishir K. Shah},
journal= {arXiv preprint arXiv:2605.06477},
year = {2026}
}