消除标题中分布性差异可改善图像-文本对齐
计算机视觉与模式识别
2024-10-02 v1
摘要
本文提出一种模型,用于提高图像-文本对齐预测,针对当前视觉语言模型中表征理解的挑战。我们的做法聚焦于生成高质量的训练数据集,通过产生源于正向标题的混合类型负向标题来实现。关键在于解决正负标题之间的分布不平衡问题,确保对齐模型不仅依赖文本信息,还要考虑关联图像才能准确预测对齐情况。通过创建这一增强训练数据,我们对现有领先的视觉语言模型进行微调,以提升其理解对齐能力。我们的模型在 various 数据集上显著超越当前顶尖方法。我们还通过对文本生成图像模型生成的图像进行排名来展示我们模型的可行性。项目页面:\url{https://yuheng-li.github.io/LLaVA-score/}
引用
@article{arxiv.2410.00905,
title = {Removing Distributional Discrepancies in Captions Improves Image-Text Alignment},
author = {Yuheng Li and Haotian Liu and Mu Cai and Yijun Li and Eli Shechtman and Zhe Lin and Yong Jae Lee and Krishna Kumar Singh},
journal= {arXiv preprint arXiv:2410.00905},
year = {2024}
}