面向图像-文本与元素匹配的指令增强多模态对齐
计算机视觉与模式识别
2025-04-17 v1
摘要
随着文本到图像(text-to-image, T2I)生成模型的快速发展,评估生成图像与文本描述之间的语义对齐已成为重要的研究挑战。当前方法,包括基于视觉问答(VQA)的方法,仍在细粒度评估和精确量化图像-文本对齐方面存在困难。本文提出了一种改进的评估方法,名为指令增强多模态对齐用于图像-文本与元素匹配(Instruction-augmented Multimodal Alignment for Image-Text and Element Matching, iMatch),该方法通过微调多模态大语言模型来评估图像-文本语义对齐。我们引入了四种创新的增强策略:首先,QAlign策略创建精确的概率映射,将多模态大语言模型的离散评分转换为连续匹配评分;其次,验证集增强策略使用模型预测的伪标签扩展训练数据,提高模型的泛化性能;其次,元素增强策略整合元素类别标签以细化模型对图像-文本匹配的理解;其次,图像增强策略采用如随机调光等技术增加模型的鲁棒性。此外,我们提出了提示类型增强和评分扰动策略进一步提高元素评估的准确性。我们的实验结果表明,iMatch方法显著优于现有方法,证明了其有效性和实际价值。此外,我们的iMatch在CVPR NTIRE 2025文本到图像生成模型质量评估 - Track 1图像-文本对齐赛项中获得了第一名。
引用
@article{arxiv.2504.12018,
title = {Instruction-augmented Multimodal Alignment for Image-Text and Element Matching},
author = {Xinli Yue and JianHui Sun and Junda Lu and Liangchao Yao and Fan Xia and Tianyi Wang and Fengyun Rao and Jing Lyu and Yuetang Deng},
journal= {arXiv preprint arXiv:2504.12018},
year = {2025}
}
备注
Accepted to CVPR 2025 Workshop