对比预训练与多模态生成式AI的统计理论
机器学习
2025-10-22 v2 统计理论
机器学习
统计理论
摘要
多模态生成式AI系统,例如结合视觉和语言的系统,依赖于对比预训练来学习跨模态的表示。虽然它们的实际益处已被广泛认可,但对对比预训练框架的严格理论理解仍然有限。本文发展了一个理论框架来解释对比预训练在下游任务(如零样本分类、条件扩散模型和视觉-语言模型)中的成功。我们引入了近似充分统计量的概念,这是经典充分统计量的推广,并表明对比预训练损失的近最小化器是近似充分的,使其能够适应各种下游任务。我们进一步提出了联合生成层次模型用于图像和文本的联合分布,表明Transformer可以通过信念传播有效逼近该模型中的相关函数。基于这一框架,我们推导了基于对比预训练表示的多模态学习的样本复杂度保证。数值模拟验证了这些理论发现,展示了对比预训练Transformer在各种多模态任务中的强大泛化性能。
引用
@article{arxiv.2501.04641,
title = {A Statistical Theory of Contrastive Pre-training and Multimodal Generative AI},
author = {Kazusato Oko and Licong Lin and Yuhang Cai and Song Mei},
journal= {arXiv preprint arXiv:2501.04641},
year = {2025}
}