中文

探索如何在多模态大型语言模型中注入有益噪声

计算机视觉与模式识别 2025-11-18 v1

摘要

多模态大型语言模型(MLLMs)在多模态智能中发挥着越来越重要的作用。然而,现有的微调方法往往忽视跨模态异构性,限制了其潜在潜力。本文提出一种新颖的微调策略,通过注入有益的随机噪声来实现优于先前方法甚至优于完整微调的效果,同时所需的额外参数极少。提出的多模态噪声生成器(MuNG)通过注入自定义噪声实现冻结MLLM的高效模态微调。具体而言,我们从变分推断视角重新表述MLLM的推理过程,据此设计一种多模态噪声生成器,动态分析图像-文本对中的跨模态关系,以生成任务适应的有益噪声。注入此类噪声到MLLM中有效抑制不相关语义组件,显著改善跨模态表征对齐,并增强下游任务的性能。在两个主流MLLM(QwenVL和LLaVA)上的实验表明,我们的方法超越了完整参数微调和其他现有微调方法,仅需约12%1\sim2\%的额外参数即可实现。相关代码已上传至补充材料中。

关键词

引用

@article{arxiv.2511.12917,
  title  = {Explore How to Inject Beneficial Noise in MLLMs},
  author = {Ruishu Zhu and Sida Huang and Ziheng Jiao and Hongyuan Zhang},
  journal= {arXiv preprint arXiv:2511.12917},
  year   = {2025}
}

备注

Accepted by AAAI 2026