面向视觉语言模型的终身知识编辑:低秩混合专家
计算与语言
2025-03-17 v2 计算机视觉与模式识别
摘要
模型编辑旨在无需重新训练的情况下纠正不准确的知识、更新过时的information并纳入新数据至大语言模型(LLMs)。该任务在终身场景中提出挑战,因为编辑必须持续应用于实际应用中。虽然一些编辑器在纯LLMs的终身编辑中表现出强大的鲁棒性,但包含额外视觉模态的视觉LLMs(VLLMs)无法直接适用于现有的LLM编辑器。本文提出LiveEdit,即一种LIfelong Vision language modEl Edit,旨在弥合终身LLM编辑与VLLMs之间的差距。我们首先训练一个编辑专家生成器,独立为每个编辑实例生成低秩专家,以纠正VLLM的相关响应。我们开发了硬过滤机制,利用视觉语义知识,在编辑后模型的推理阶段粗略消除输入查询期间与之无关的视觉专家。最后,为了集成视觉相关专家,我们引入基于文本语义相关性的软路由机制,以实现多专家融合。对于评估,我们建立了一个面向终身VLLM编辑的基准。大量实验表明,LiveEdit在终身VLLM编辑场景中显著优于现有方法。进一步实验验证了LiveEdit中每个模块设计的合理性与有效性。
引用
@article{arxiv.2411.15432,
title = {Lifelong Knowledge Editing for Vision Language Models with Low-Rank Mixture-of-Experts},
author = {Qizhou Chen and Chengyu Wang and Dakan Wang and Taolin Zhang and Wangyue Li and Xiaofeng He},
journal= {arXiv preprint arXiv:2411.15432},
year = {2025}
}
备注
CVPR 2025 Accepted