面向终身VLM编辑的动态子空间概念对齐(DSCA)
计算机视觉与模式识别
2026-04-10 v1 人工智能
机器学习
摘要
模型编辑旨在更新知识以添加新概念和更改相关信息,而无需重新训练。终身编辑是一项具有挑战性的任务,尤其是针对视觉语言模型(VLM),因为顺序编辑可能导致已学习的概念受损,尤其是跨模态误差。现有的VLM知识编辑方法基于门控适配器、激活编辑和参数合并技术,旨在解决全微调中看似遗忘的问题;然而,这些方法仍在VLM的共享表示空间中运作,概念在该空间中被缠结,导致编辑干扰其他非相关概念。我们假设,这种不稳定性持续存在,因为当前方法通过优化而非结构性地控制编辑。我们引入动态子空间概念对齐(DSCA),通过将表示空间分解为一组正交语义子空间并在这些变换空间中提出编辑来设计性地缓解此限制。这些子空间通过对联合视觉语言表示进行增量聚类和PCA获得。这一过程从结构上隔离概念,使编辑能够实现精确且不相互干扰,将从软训练目标到架构属性的隔离。手术编辑由用于保持任务忠实性、编辑局部性和跨模态对齐的多项损失函数引导。在冻结基础模型的情况下,我们的方法实现了98%的单次编辑成功率,1000次顺序编辑后仍保持95%以上的性能,将幻觉降低3-5个百分点,并在持续指令调优基准测试中实现最佳的逆向迁移(BWT)分数。广泛的实验表明DSCA在各种数据集和基准测试上在持续终身编辑中实现了最先进的稳定性和知识保留能力。
引用
@article{arxiv.2604.07965,
title = {DSCA: Dynamic Subspace Concept Alignment for Lifelong VLM Editing},
author = {Gyanendra Das and Sai Satyam Jena},
journal= {arXiv preprint arXiv:2604.07965},
year = {2026}
}
备注
Accepted at CVPR 2026