中文

AEGIS:面向知识保留的视觉语言-动作微调中的锚点强制梯度隔离

机器学习 2026-04-20 v1 计算机视觉与模式识别

摘要

为机器人控制适配预训练视觉语言模型(VLM),需要将来自流匹配动作专家的高幅度连续梯度注入仅使用交叉熵训练的 backbone 中。这种跨模态梯度不对称——即低秩 MSE 回归梯度与 CE 预训练所塑造的高维语义流形之间的谱维度不匹配——会导致 VLM 的视觉-问题-答案(VQA)能力迅速、严重地被破坏。行业标准的防御要么通过 stop gradient 完全切断梯度路径,丢弃丰富的连续监督,要么通过低秩适配器(LoRA)限制更新的秩但不限制其方向,仍会覆盖预训练的流形。我们提出 AEGIS(Anchor-Enforced Gradient Isolation System):一个无缓冲区、按层进行正交梯度投影的框架,使其能够在保留预训练 VQA 流形的同时,直接进行连续 MSE 学习——无需任何协训练数据或回放缓冲区。AEGIS 从掩码 VQA 前向传播中预计算所有 transformer 层的静态高斯锚点参考,然后在每个训练步骤中构建 Wasserstein-2 传输惩罚,以生成锚点恢复梯度。序列双反向分解任务梯度与锚点梯度;对于每个 transformer 层,AEGIS 应用单次 Gram-Schmidt 正交投影,将任务梯度向破坏性方向偏转,同时保留其建设性内容。该投影平均每层仅丢弃不到 1% 的梯度能量,却消除导致严重遗忘的累积激活漂移。

关键词

引用

@article{arxiv.2604.16067,
  title  = {AEGIS: Anchor-Enforced Gradient Isolation for Knowledge-Preserving Vision-Language-Action Fine-Tuning},
  author = {Guransh Singh},
  journal= {arXiv preprint arXiv:2604.16067},
  year   = {2026}
}