面向多样性与高质量生成的群推理比例扩张
计算机视觉与模式识别
2025-08-22 v1 图形学
机器学习
摘要
生成模型通常独立地采样输出,最近的推理时间指导和比例扩张算法专注于提高单个样本的质量。然而,在实际应用中,用户通常会针对每个提示获得 4-8 个图像,独立采样会导致结果冗余,限制用户选择并阻碍想象力探索。本文引入一种可扩展的群推理方法,以提高一组样本的多样性和质量。我们将群推理形式化为一个二次整数分配问题:候选输出被建模为图节点,选取的子集需在优化样本质量(一元项)的同时最大化群体多样性(二元项)。为显著提升运行时效率,我们使用中间预测逐步修剪候选集合,使方法能够扩展到大规模候选集合。广泛的实验表明,我们的方法在多样性和质量方面显著优于独立采样基线和最新推理算法。我们的框架适用于广泛的任务,包括文本到图像、图像到图像、图像提示和视频生成,使生成模型能够将多个输出视为独立样本,而非 cohesive 群体。
引用
@article{arxiv.2508.15773,
title = {Scaling Group Inference for Diverse and High-Quality Generation},
author = {Gaurav Parmar and Or Patashnik and Daniil Ostashev and Kuan-Chieh Wang and Kfir Aberman and Srinivasa Narasimhan and Jun-Yan Zhu},
journal= {arXiv preprint arXiv:2508.15773},
year = {2025}
}
备注
Project website: https://www.cs.cmu.edu/~group-inference, GitHub: https://github.com/GaParmar/group-inference