CARINOX:基于类别感知奖励驱动的初始噪声优化与探索推理时间扩展方法
计算机视觉与模式识别
2026-04-14 v3 计算与语言
摘要
文本到图像扩散模型(如 Stable Diffusion)能够生成高质量且多样化的图像,但在处理提示中描述复杂对象关系、属性或空间布局时,常常难以实现构图对齐。近期的推理时间方法通过优化或探索初始噪声来实现这一目标,同时利用不需模型微调即可对文本-图像对齐性进行评分的奖励函数。尽管已展现前景,但单独使用这些策略均存在内在局限:优化可能因初始化不佳或搜索轨迹不利而停滞,而探索则可能需要大量样本才能找到满意的输出。我们进一步分析发现,单一奖励指标或不成熟的组合方式均无法可靠地捕捉构图的所有方面,导致指导效果弱或不一致。为克服此挑战,我们提出了类别感知奖励驱动的初始噪声优化与探索框架(CARINOX),该框架结合了噪声优化与探索,并基于与人类判断相关性的原则性奖励选择程序。评估两个覆盖多样构图挑战的基准测试表明,CARINOX 在 T2I-CompBench++ 上将平均对齐得分提升 16%,在 HRS 数据集上提升 11%,在所有主要类别中均稳定优于最新的优化与探索方法,同时保持图像质量和多样性。项目页面地址为 https://amirkasaei.com/carinox/。
引用
@article{arxiv.2509.17458,
title = {CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration},
author = {Seyed Amir Kasaei and Ali Aghayari and Arash Marioriyad and Niki Sepasian and Shayan Baghayi Nejad and MohammadAmin Fazli and Mahdieh Soleymani Baghshah and Mohammad Hossein Rohban},
journal= {arXiv preprint arXiv:2509.17458},
year = {2026}
}
备注
Accepted at TMLR (2026)