增强以文本为中心的多模态对齐的鲁棒性
计算与语言
2024-07-09 v1 机器学习
摘要
将不同模态转换为通用文本,作为大型语言模型(LLM)的输入提示,是在配对数据有限时对齐多模态模型的一种常见方法。这种以文本为中心的方法利用了文本作为模态空间的独特属性,将多样化的输入转换为统一的文本表示。这使得下游模型能够有效地解释各种模态输入。本研究评估了在存在缺失条目、噪声或缺失模态情况下多模态表示的质量和鲁棒性,揭示了当前以文本为中心的对齐方法会损害下游鲁棒性。为了解决这个问题,我们提出了一种新的以文本为中心的方法,该方法在不同设置下的各种模态中,与先前方法相比实现了卓越的鲁棒性。我们的研究结果强调了该方法在增强多模态表示的鲁棒性和适应性方面的潜力,为动态和现实世界的应用提供了一个有前景的解决方案。
引用
@article{arxiv.2407.05036,
title = {Enhance the Robustness of Text-Centric Multimodal Alignments},
author = {Ting-Yu Yen and Yun-Da Tsai and Keng-Te Liao and Shou-De Lin},
journal= {arXiv preprint arXiv:2407.05036},
year = {2024}
}