中文

低数据设置下多模态对齐的方差感知损失调度

计算机视觉与模式识别 2025-03-06 v1

摘要

训练视觉-语言模型进行图像-文本对齐通常需要大规模数据集以获得鲁棒性能。在低数据场景下,标准对比学习由于过拟合和不稳定的训练动态,难以有效对齐模态。本文提出一种方差感知损失调度方法,根据模型对齐预测的统计变异性(不确定性)动态调整对比损失的权重。使用Flickr8k图像-标题数据集的一个子集模拟有限数据条件,我们证明该方法相比固定权重基线提升了图像-文本检索准确率。我们还与其他自适应加权策略(使用输出熵和余弦相似度散布)进行了比较,发现方差感知调度提供了最佳的整体权衡。在定性方面,我们的方法通过t-SNE可视化产生了更显著的多模态嵌入。此外,在注入噪声的标题和图像的压力测试中,方差引导损失证明了更强的鲁棒性,在引入随机扰动时保持了更高的召回率。这些结果凸显了自适应损失加权在低数据条件下多模态对齐中的优势。

关键词

引用

@article{arxiv.2503.03202,
  title  = {Variance-Aware Loss Scheduling for Multimodal Alignment in Low-Data Settings},
  author = {Sneh Pillai},
  journal= {arXiv preprint arXiv:2503.03202},
  year   = {2025}
}

备注

8 pages, 4 figures