MAR-MAER:基于度量感知与模糊性自适应的自回归图像生成
计算机视觉与模式识别
2026-04-03 v1
摘要
自回归(AR)模型在文本到图像生成领域取得了显著的成功。然而,这些模型通常面临两个主要挑战。首先,生成的图像可能无法满足人类的预期质量标准。其次,这些模型在处理可能以多种有效方式解释的模糊提示时会感到困难。为解决这些问题,我们提出了MAR-MAER,这是一种创新的分层自回归框架。它包含两个主要组件:一个度量感知嵌入正则化方法,以及一个用于处理模糊语义的概率潜在模型。我们的方法利用一个轻量级投影头,并通过自适应核回归损失函数进行训练。这一过程将模型的内部表示与人类偏好质量指标(如CLIPScore和HPSv2)对齐,从而更准确地反映人类判断。我们还引入了一个条件变分模块。该方法在分层标记生成过程中 incorporates 一种受控随机性,使模型能够基于模糊或开放式提示生成多样化且连贯的图像。我们使用COCO数据集和新开发的模糊提示基准进行了大量实验。结果表明,MAR-MAER在指标一致性和语义灵活性方面均取得了优异的表现,超过了基线Hi-MAR模型,CLIPScore提升了+1.6,HPSv2提升了+5.3。对于不清晰的输入,模型能够产生显著更广泛的输出。这些发现通过人类评估和自动化指标均得到了确认。
引用
@article{arxiv.2604.01864,
title = {MAR-MAER: Metric-Aware and Ambiguity-Adaptive Autoregressive Image Generation},
author = {Kai Dong and Tingting Bai},
journal= {arXiv preprint arXiv:2604.01864},
year = {2026}
}
备注
Accepted by AMME 2025