中文

诱导的数值不稳定:多模态大语言模型中的隐藏代价

计算与语言 2026-03-06 v1 人工智能 机器学习

摘要

多模态大语言模型的使用日益广泛,因此对这些模型及其故障点的研究变得至关重要。我们研究了一种导致性能间接降解的新型故障模式,即优化一个旨在最大化这些模型推理阶段数值不稳定性的损失项。我们将该损失项作为优化目标,用于构造图像,当这些图像被用于多模态大语言模型时,会导致显著的输出性能降解。我们在最先进的模型(LLaVa-v1.5-7B、Idefics3-8B、SmolVLM-2B-Instruct)上验证了我们的假设,这些模型分别针对标准数据集(Flickr30k、MMVet、TextVQA、VQAv2、POPE、COCO)进行测试,结果表明即使对输入图像进行极小的改变,性能也会显著下降,远超基线方法。我们的结果揭示了一种不同于对抗性扰动所捕获的性能降解向量,凸显了这种故障模式的重要性。

关键词

引用

@article{arxiv.2603.04453,
  title  = {Induced Numerical Instability: Hidden Costs in Multimodal Large Language Models},
  author = {Wai Tuck Wong and Jun Sun and Arunesh Sinha},
  journal= {arXiv preprint arXiv:2603.04453},
  year   = {2026}
}