面向鲁棒多模态大语言模型的动态对抗强化学习
机器学习
2026-03-05 v3 人工智能
摘要
尽管多模态大语言模型 (MLLM) 在各方面展现了惊人的能力,但在面对视觉复杂场景时仍表现出感知脆弱性。这一弱点源于其依赖有限的训练数据集,大规模扩充昂贵且限制了模型鲁棒性。我们提出 **AOT-SFT**,一个大规模对抗数据集,用于引导 MLLM 鲁棒性。基于此,我们提出 **AOT (Adversarial Opponent Training)**,一个自我对弈框架,通过自身生成训练数据来塑造 MLLM 的鲁棒性。该方法协调一个图像编辑攻击者与防御 MLLM 之间的协同演化,攻击者生成多样且动态的图像操作课程,迫使防御 MLLM 适应并提升。大量实验表明,AOT 提升了防御方的感知鲁棒性并减少了幻觉现象,建立了一个可扩展的范式,用于训练更可靠的 MLLM。
引用
@article{arxiv.2602.22227,
title = {Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models},
author = {Yicheng Bao and Xuhong Wang and Qiaosheng Zhang and Chaochao Lu and Xia Hu and Xin Tan},
journal= {arXiv preprint arXiv:2602.22227},
year = {2026}
}