中文

MINOS:面向图像与文本双向生成的多模态评估模型

计算与语言 2026-04-30 v2 人工智能 计算机视觉与模式识别

摘要

评估对于多模态生成任务非常重要,而传统的多模态评估指标存在若干局限性。随着 MLLM 的快速发展,人们越来越有兴趣应用 MLLM 构建通用评估系统。然而,现有的研究往往只是简单收集大规模评估数据进行训练,而忽视了评估数据的质量。此外,当前提出的评估模型往往难以在图像到文本(I2T)和文本到图像(T2I)任务上同时保持强劲性能。在本文中,通过严格的质量控制策略,我们构建了一个全面的多模态评估数据集 Minos-57K,包含跨 15 个数据集的评估样本,用于通过 SFT 和偏好对齐训练策略开发多模态评估模型 Minos。值得注意的是,尽管使用的训练数据规模不到先前工作的一半,我们的模型在涵盖 I2T 和 T2I 任务的 16 个域外数据集上,在所有开源多模态评估模型中取得了 SOTA 的评估性能,并与闭源模型保持竞争力。大量实验证明了利用质量控制过程、在 I2T 和 T2I 生成任务的评估数据上进行联合训练以及进一步偏好对齐的重要性。

关键词

引用

@article{arxiv.2506.02494,
  title  = {MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text},
  author = {Junzhe Zhang and Huixuan Zhang and Xinyu Hu and Li Lin and Mingqi Gao and Shi Qiu and Xiaojun Wan},
  journal= {arXiv preprint arXiv:2506.02494},
  year   = {2026}
}

备注

Accepted to the Findings of ACL 2026