使用 LoReTTa 训练传递与交换多模态 Transformer
人工智能
2024-01-18 v5 计算机视觉与模式识别
摘要
由于多模态数据集的有限可用性,训练多模态基础模型具有挑战性。虽然许多公开数据集将图像与文本配对,但很少将图像与音频或文本与音频结合。更罕见的是同时对齐所有三种模态的数据集。医疗、基础设施或交通等关键领域尤其受缺失模态的影响。这使得难以将所有模态整合进一个大型预训练神经网络中,以便开箱即用或微调用于不同下游任务。我们引入 LoReTTa(Linking mOdalities with a tRansitive and commutativE pre-Training sTrAtegy,以传递与交换预训练策略链接模态)来解决这一研究不足的问题。我们的自监督框架将因果建模与掩码建模同交换性与传递性规则相统一。这使我们能在模态之内与模态之间转换。结果,我们的预训练模型更善于探索真实的潜在联合概率分布。给定仅含不相交组合 (A, B) 与 (B, C) 的数据集,LoReTTa 可通过 A <-> B <-> C 建模关系 A <-> C。我们特别表明,用 LoReTTa 预训练的 transformer 在推理时可处理任意模态组合,包括从未见过的配对 (A, C) 与三元组 (A, B, C)。我们在合成、医疗与强化学习数据集上广泛评估了我们的方法。在不同领域中,我们的通用多模态 transformer 在涉及缺失模态元组的任务上持续优于 GPT、BERT 和 CLIP 等强基线。
引用
@article{arxiv.2305.14243,
title = {Training Transitive and Commutative Multimodal Transformers with LoReTTa},
author = {Manuel Tran and Yashin Dicente Cid and Amal Lahiani and Fabian J. Theis and Tingying Peng and Eldad Klaiman},
journal= {arXiv preprint arXiv:2305.14243},
year = {2024}
}
备注
Accepted at NeurIPS 2023 (poster). Camera-ready version