面向多模态学习的以文本为中心的对齐
机器学习
2024-05-22 v2 计算与语言
计算机视觉与模式识别
摘要
本研究论文解决了多模态学习中的模态不匹配挑战,即推理阶段可用的模态与训练阶段可用的模态不同。我们提出了面向多模态学习的以文本为中心的对齐(Text-centric Alignment for Multi-Modality Learning, TAMML)方法,这是一种创新方法,利用具有上下文学习(in-context learning)能力的大语言模型(LLMs)和基础模型,以增强多模态系统在这些条件下的泛化能力。通过利用文本作为统一语义空间的独特属性,TAMML 在处理未见过的、多样化的和不可预测的模态组合方面展示了显著的改进。TAMML 不仅能适应不同的模态,还能保持稳健的性能,展现了基础模型在克服传统固定模态框架在嵌入表示方面局限性的潜力。本研究通过提供一种灵活、有效的解决方案,为模态可用性动态且不确定的现实世界应用做出了贡献。
引用
@article{arxiv.2402.08086,
title = {Text-centric Alignment for Multi-Modality Learning},
author = {Yun-Da Tsai and Ting-Yu Yen and Pei-Fu Guo and Zhe-Yan Li and Shou-De Lin},
journal= {arXiv preprint arXiv:2402.08086},
year = {2024}
}