惊人脆弱性:评估与解决多模态基础模型中的提示不稳定性
计算与语言
2025-11-19 v2
摘要
多模态基础模型(MFM)如 OFASys 显示了通过文本提示alone 分析图像、视频和音频数据等复杂数据的潜力。然而,面对与训练分布略有不同的文本输入,性能可能受到影响,这在使用特定模态数据来“ grounding”文本输入方面颇具意外。本研究表明,提示不稳定性是MFM的一个主要关注点,导致所有模态上性能稳定下降,但通过使用增强数据进行额外训练可缓解不稳定性。我们评估了几种基于相似性与文本和/或模态数据进行 grounding 提示扰动的方法。经过在增强数据上重新训练后,我们发现无论扰动条件如何,都在扰动测试数据上实现更高的准确率和更稳定的性能,表明数据增强策略有助于模型更有效地处理领域迁移。在错误分析中,我们发现跨领域的性能提升呈现出一致模式,表明对提示扰动的再训练倾向于有助于MFM的通用推理能力。
引用
@article{arxiv.2408.14595,
title = {Surprisingly Fragile: Assessing and Addressing Prompt Instability in Multimodal Foundation Models},
author = {Ian Stewart and Sameera Horawalavithana and Brendan Kennedy and Sai Munikoti and Karl Pazdernik},
journal= {arXiv preprint arXiv:2408.14595},
year = {2025}
}
备注
arxiv