MMMG:多任务多模态生成综合可靠评估套件
人工智能
2025-05-26 v1 计算与语言
计算机视觉与模式识别
摘要
自动评估多模态生成是一项重大挑战,因为自动指标往往难以与人类评估可靠对齐,尤其是在涉及多种模态的复杂任务中。为此,我们提出MMMG,一个全面且与人类对齐的多模态生成基准,涵盖4种模态组合(图像、音频、交错文本与图像、交错文本与音频),重点评估对生成模型构成重大挑战的任务,同时通过模型与程序的组合实现可靠的自动评估。MMMG包含49个任务(其中29个为新开发),每个任务都有精心设计的评估流程,以及937条指令,用于系统评估多模态生成模型的推理能力、可控性及其他关键能力。广泛验证表明MMMG与人类评估高度一致,平均一致率达94.3%。在24个多模态生成模型上的基准测试结果表明,即使最先进模型GPT Image在图像生成上达到78.3%准确率,但在多模态推理和交错生成方面仍存在不足。此外,结果表明音频生成仍有显著提升空间,为未来研究指明了重要方向。
引用
@article{arxiv.2505.17613,
title = {MMMG: a Comprehensive and Reliable Evaluation Suite for Multitask Multimodal Generation},
author = {Jihan Yao and Yushi Hu and Yujie Yi and Bin Han and Shangbin Feng and Guang Yang and Bingbing Wen and Ranjay Krishna and Lucy Lu Wang and Yulia Tsvetkov and Noah A. Smith and Banghua Zhu},
journal= {arXiv preprint arXiv:2505.17613},
year = {2025}
}