视觉自回归生成的对抗性误差校正
计算机视觉与模式识别
2026-05-26 v1 人工智能
摘要
视觉自回归(VAR)模型已成为通过进行层次化 next-scale 预测实现图像合成的强大范式。然而,VAR 模型本质上容易出现级联误差传播,其中细微的粗尺度误预测在层次结构中被放大,最终扭曲最终合成结果。为缓解此问题,我们提出 AID-VAR,一个即插即用的框架,通过对抗注入诊断(Adversarially Injected Diagnosis)增强预训练的 VAR。与标准被动生成不同,AID-VAR 引入受 GAN 对抗反馈启发的主动误差校正机制。我们部署判别器在每个尺度转换处诊断保真度差距,配合轻量级 guidance injector。该模块作为非侵入式适配器,精炼预训练 VAR 主干的特征流形,有效地将生成引导向真实图像分布,而不致扰乱预训练的潜在空间。此外,为严格评估跨尺度进展,我们引入了 Inter-Scale Consistency Score(ISCS),一种新颖的度量,用于量化连续分辨率尺度之间的保真度和结构对齐程度。实验结果表明,AID-VAR 在各种主干模型上均能提供更锐利的纹理细节和更少的结构扭曲,仅增加 3% 参数即可实现 16% 的 FID 提升。这些结果表明,AID-VAR 是一条高效且可扩展的路径,能够在不改变训练数据、基本架构或采样计划的前提下升级大规模 VAR 生成器,提升全局一致性和局部细节。代码地址:https://github.com/bijiw515/AID-VAR。
引用
@article{arxiv.2605.24843,
title = {Adversarial Error Correction for Visual Autoregressive Generation},
author = {Ligong Bi and Tao Huang and Jianyuan Guo and Chang Xu},
journal= {arXiv preprint arXiv:2605.24843},
year = {2026}
}