基于补丁的跨视图正则化框架用于多模态大语言模型后门防御
计算机视觉与模式识别
2026-04-07 v1 机器学习
摘要
多模态大语言模型已成为统一处理视觉和语言任务的重要基础设施。然而,这类模型在监督微调期间高度易受后门植入,一旦触发特定触发模式,便会持续输出攻击者预定义的有害响应。后门防御的核心挑战在于在保持模型正常生成能力的同时压制低投毒比例下的攻击成功率。这两种目标本质上存在冲突。强力抑制会降低良好性能,而弱正则化则无法有效缓解后门行为。为此,我们提出一种统一的防御框架,基于补丁增强和跨视图正则化,同时从特征表示和输出分布两个层面约束模型对触发模式响应中的异常行为。具体而言,结合补丁级数据增强和跨视图输出差异正则化,利用后门响应对非语义扰动异常不变性这一事实,并主动拉开原始视图与扰动视图之间的输出分布,从而显著压制后门触发成功率。同时,通过施加输出熵约束,避免在防御过程中过度抑制模型,确保正常命令生成的质量。实验结果表明,在三个模型、两个任务和六种攻击情景下,我们提出的防御方法有效降低了攻击成功率,同时保持了高水平的正常文本生成能力。我们的工作使大规模多模态模型在真实世界低频率投毒和隐蔽触发场景下得以安全、可控地部署。
引用
@article{arxiv.2604.04488,
title = {A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models},
author = {Tianmeng Fang and Yong Wang and Zetai Kong and Zengzhen Su and Jun Wang and Chengjin Yu and Wei Wang},
journal= {arXiv preprint arXiv:2604.04488},
year = {2026}
}
备注
26 pages, 3 figures. Subjects: Machine Learning (cs.LG)