条件图像生成模型的一致性-多样性-真实性 Pareto 前沿
计算机视觉与模式识别
2024-06-18 v1 人工智能
摘要
构建能够准确且全面代表现实世界的世界模型,是条件图像生成模型的终极目标,因为这能够使其成为世界模拟器。为了成功地成为世界模型,这些模型不仅要在图像质量和提示-图像一致性方面表现优异,还必须确保高表示多样性。然而,当前的生成模型研究主要聚焦于创意应用,主要关心人类对图像质量和美学的偏好。我们注意到,生成模型具有推理时间机制(即旋钮),可用于控制生成过程的一致性、质量和多样性。本文使用最新的文本到图像和图像+文本到图像模型及其旋钮,绘制了一致性-多样性-真实性 Pareto 前沿,提供了一致性-多样性-真实性多目标的整体视图。我们的实验表明,真实性和一致性可以同时提升;但真实性/一致性与多样性之间存在明显的权衡。通过查看 Pareto 最优点,我们注意到早期模型在表示多样性方面更优,同时在一致性/真实性方面较差;而更近期的模型在一致性/真实性方面表现更佳,但显著降低了表示多样性。通过在地理上多样化的数据集上计算 Pareto 前沿,我们发现潜在扩散模型的第一个版本在所有评估轴线上往往优于更新的模型,并且存在明显的一致性-多样性-真实性差异。总体而言,我们的分析清晰地表明,没有哪个模型是最佳模型,模型的选择应取决于具体的下游应用。通过这一分析,我们邀请研究社区将 Pareto 前沿作为衡量向世界模型发展进程的分析工具。
引用
@article{arxiv.2406.10429,
title = {Consistency-diversity-realism Pareto fronts of conditional image generative models},
author = {Pietro Astolfi and Marlene Careil and Melissa Hall and Oscar Mañas and Matthew Muckley and Jakob Verbeek and Adriana Romero Soriano and Michal Drozdzal},
journal= {arXiv preprint arXiv:2406.10429},
year = {2024}
}