中文

文本到图像生成的自动评估:任务分解框架、蒸馏训练与元评估基准

计算与语言 2024-11-26 v1 人工智能 计算机视觉与模式识别

摘要

受扩散模型突破性进步的推动,文本到图像生成取得了显著进展,导致对生成图像自动质量评估提出迫切需求。当前领先的自动评估方法高度依赖多模态大语言模型(MLLM),尤其是像GPT-4o等强大的商业模型。虽然这些模型效果卓越,但其高额成本限制了大规模评估的可扩展性。采用开源 MLLM 是一种替代方案;然而,由于在处理多模态数据方面存在显著局限,其性能不足。为解决这些问题,本文首先提出一种基于GPT-4o的任务分解评估框架,用于自动构建新的训练数据集,其中将复杂的评估任务分解为更简单的子任务,从而有效降低学习复杂度。基于此数据集,我们设计了创新的训练策略,在7B参数的开源 MLLM MiniCPM-V-2.6 中有效蒸馏GPT-4o的评估能力。此外,为可靠全面地评估现有工作和我们提出的模型,我们手动标注了一个包含链式思维解释与生成图像质量分数一起的元评估基准。实验结果表明,我们的蒸馏开源 MLLM在与人类判断的斯佩尔相关系数和肯德尔相关系数上,相比当前领先的GPT-4o-base基线模型VIEScore提升了超过4.6%。

关键词

引用

@article{arxiv.2411.15488,
  title  = {Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark},
  author = {Rong-Cheng Tu and Zi-Ao Ma and Tian Lan and Yuehao Zhao and Heyan Huang and Xian-Ling Mao},
  journal= {arXiv preprint arXiv:2411.15488},
  year   = {2024}
}