OpenING:用于评判开放式交错图像文本生成的综合基准
计算机视觉与模式识别
2025-04-01 v3
摘要
多模态大语言模型(MLLM)在视觉理解和生成任务方面取得了显著进展。然而,生成交错的图像文本内容仍是一个挑战,这需要集成的多模态理解和生成能力。虽然统一模型的进展提供了新解决方案,但现有基准由于数据规模和多样性的限制,对于评估这些方法不够充分。为弥合这一差距,我们介绍了OpenING,一个包含5400个高质量人工标注实例的综合基准,覆盖56个真实世界任务。OpenING涵盖旅游指南、设计和头脑风暴等多样化日常场景,为挑战性的交错生成方法提供了稳健的平台。此外,我们提出了IntJudge,用于评估开放式多模态生成方法的评判模型。通过新颖的数据管道进行训练,IntJudge与人类判断的一致率达到82.42%,超越基于GPT的评估器11.34%。在OpenING上进行大量实验表明,当前的交错图像文本生成方法仍有大大的提升空间。进一步提出了关于交错图像文本生成的关键发现,以指导下一代模型的开发。
引用
@article{arxiv.2411.18499,
title = {OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text Generation},
author = {Pengfei Zhou and Xiaopeng Peng and Jiajun Song and Chuanhao Li and Zhaopan Xu and Yue Yang and Ziyao Guo and Hao Zhang and Yuqi Lin and Yefei He and Lirui Zhao and Shuo Liu and Tianhua Li and Yuxuan Xie and Xiaojun Chang and Yu Qiao and Wenqi Shao and Kaipeng Zhang},
journal= {arXiv preprint arXiv:2411.18499},
year = {2025}
}
备注
53 pages, 19 figures, accepted by CVPR 2025