中文

模态解耦在线递归编辑

机器学习 2026-05-21 v1 人工智能

摘要

多模态大语言模型(MLLM)的在线模型编辑需要在严格的计算和内存预算下吸收一系列纠正。然而,针对文本-only LLM 开发的编辑器在 MLLM 上往往会出现性能下降:视觉主导的激活会扭曲塑造更新的统计数据,导致跨模态冲突;同时,顺序写入在共享的编辑空间中相互缠结并放大长程干扰,导致编辑间的相互干扰。为此,我们提出了 M-ORE(Modality-Decoupled Online Recursive Editor),一种用于终身 MLLM 适应的模态解耦在线递归编辑器。M-ORE 基于统一的proximal-projection 公式推导,具有闭式更新并可通过Sherman-Morrison 递归实现,从而实现恒定的 per-edit 开销。它维护文本堆栈和视觉投影器的模块级局部统计信息,以避免视觉主导的更新塑造,并通过Sherman-Morrison 递归在固定正交低秩编辑子空间中进行持续更新,以缓解长程干扰。在多个 MLLM 主干模型和在线编辑基准测试中,实验表明,我们的 M-ORE 方法在可靠性、通用性和局部性方面 consistently 优于强基线,同时实现了 favorable 的质量-效率比例。我们的代码已公开于 https://github.com/lab-klc/M-ORE。

关键词

引用

@article{arxiv.2605.20273,
  title  = {Modality-Decoupled Online Recursive Editing},
  author = {Siyuan Li and Youyuan Zhang and Fangming Liu and Jing Li},
  journal= {arXiv preprint arXiv:2605.20273},
  year   = {2026}
}