自描述多模态交互微调:放大可利用的冗余以实现鲁棒的视觉语言模型
计算机视觉与模式识别
2026-05-12 v1 人工智能
机器学习
摘要
当前的视觉语言模型在面对模糊或损坏的模态时,会出现幻觉和鲁棒性问题。我们假设,这些问题可以通过利用模态间的共享信息来补偿受损模态来解决。为此,我们分析了多模态交互——模态提供的冗余(共享)、独特(独占)和协同(涌现)的任务相关信息——以确定它们对模型可靠性的影响。具体来说,放大冗余交互将增加这种可利用的共享信息,从而解决这些问题;然而,现代的指令数据集通常为了优先考虑视觉定位而消除冗余。我们通过一个以多模态交互门为特色的自描述工作流程来弥合这一差距:这是一种将独特交互转换为冗余交互的机制。我们的研究结果表明,增加冗余可以将视觉诱导的错误减少38.3%,并将一致性提高16.8%。
引用
@article{arxiv.2605.08145,
title = {Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models},
author = {Yuriel Ryan and Hei Man Ip and Adriel Kuek and Paul Pu Liang and Roy Ka-Wei Lee},
journal= {arXiv preprint arXiv:2605.08145},
year = {2026}
}
备注
Accepted to ICML 2026