面向安全对齐多模态大语言模型的持续视觉指令调优中的和谐参数适应
计算机视觉与模式识别
2025-11-26 v1
摘要
虽然持续视觉指令调优(CVIT)在适应多模态大语言模型(MLLMs)方面显示出前景,但现有研究主要关注那些没有安全对齐的模型。这一关键疏漏忽略了实际中MLLMs本就需要此类机制来缓解潜在风险的事实。在本工作中,我们将注意力转向针对安全对齐MLLMs的CVIT,并观察到在持续适应期间,模型不仅会遭受任务遗忘,还会表现出安全性能的下降。在平衡安全与任务性能之间实现和谐仍是一个关键挑战。为此,我们提出了和谐参数适应(Harmonious Parameter Adaptation, HPA),一个包含基于聚焦的参数划分、和谐平衡的参数选择以及正交参数调整的后训练框架。具体而言,HPA根据参数对安全或任务性能的聚焦程度将参数划分为两类,并从平衡的角度选择聚焦参数以予以保留。此外,HPA对参数更新施加正交约束,以进一步缓解恶性遗忘。在CVIT基准和安全评估数据集上的大量实验表明,HPA在维持高水平安全性和减轻遗忘方面优于现有基线方法。
引用
@article{arxiv.2511.20158,
title = {Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMs},
author = {Ziqi Wang and Chang Che and Qi Wang and Hui Ma and Zenglin Shi and Cees G. M. Snoek and Meng Wang},
journal= {arXiv preprint arXiv:2511.20158},
year = {2025}
}