SOTAlign:基于最优传输的半监督视觉-语言模型对齐
机器学习
2026-02-27 v1 人工智能
摘要
柏拉图式表征假设认为,针对不同模态训练的神经网络会趋向于共享的统计世界模型。最近的工作通过对齐冻结预训练的视觉和语言模型来利用这种收敛,但通常依赖对比损失和数百万配对样本。在本工作中,我们提出:是否可以在大幅减少监督情况下实现有意义的对齐。我们引入一种半监督设置,即使用少量图像-文本配对样本以及大量非配对数据来对齐预训练的单模态编码器。为此,我们提出 SOTAlign,一个两阶段框架:第一阶段使用线性教师师从有限配对数据中恢复粗糙的共享几何;第二阶段通过基于最优传输的散度在非配对样本上进行细化,对齐过程无需对目标空间过度约束。与现有半监督方法不同,SOTAlign 有效地利用非配对图像和文本,跨数据集和编码器对学习出鲁棒的联合嵌入,并显著优于监督和半监督基线。
引用
@article{arxiv.2602.23353,
title = {SOTAlign: Semi-Supervised Alignment of Unimodal Vision and Language Models via Optimal Transport},
author = {Simon Roschmann and Paul Krzakala and Sonia Mazelet and Quentin Bouniot and Zeynep Akata},
journal= {arXiv preprint arXiv:2602.23353},
year = {2026}
}
备注
Preprint