通过对抗提示增强文本中心多模态对齐中的模态鲁棒性
机器学习
2024-08-20 v1
摘要
将不同模态转换为通用文本,然后将其作为大语言模型 (LLM) 的输入提示,是对齐多模态模型的常用方法,尤其是在成对数据有限的情况下。文本中心对齐方法利用文本作为模态空间的独特属性,将多样化输入转换为统一的文本表示,从而使下游模型能够有效解释各种模态输入。本研究评估了多模态表示在面对噪声缺陷、动态输入顺序排列和缺失模态时的质量与鲁棒性,揭示了当前的文本中心对齐方法可能损害下游鲁棒性。为了解决这一问题,我们提出了一种新的文本中心对抗训练方法,与传统的鲁棒训练方法和预训练多模态基础模型相比,显著增强了鲁棒性。我们的发现强调了这种方法在提高多模态表示的鲁棒性和适应性方面的潜力,为动态和现实应用提供了有前景的解决方案。
引用
@article{arxiv.2408.09798,
title = {Enhance Modality Robustness in Text-Centric Multimodal Alignment with Adversarial Prompting},
author = {Yun-Da Tsai and Ting-Yu Yen and Keng-Te Liao and Shou-De Lin},
journal= {arXiv preprint arXiv:2408.09798},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2407.05036