中文

可解释潜在奖励的自纠正图像生成

计算机视觉与模式识别 2026-03-27 v1 人工智能

摘要

尽管文本到图像生成取得了显著进展,但与复杂提示保持对齐仍具有挑战性,尤其是针对细粒度语义和空间关系。这种困难源于生成的前馈特性,要求在完全理解输出之前就预测对齐。在 contrastively, 评估生成图像更为可行。基于这种非对称性,我们提出了xLARD框架,通过可解释潜在奖励(Explainable LAtent RewarDs)指导生成。xLARD引入轻量级纠正器,基于模型生成参考的结构化反馈来细化潜在表示。关键组件是从潜在编辑映射到可解释奖励信号的可微分映射,使非可微分图像级评估能够在潜在层面提供连续指导。这种机制使模型能够在生成过程中理解、评估并自我纠正。跨多样化生成和编辑任务的实验表明,xLARD在保持生成先验的同时,提高了语义对齐和视觉保真度。代码已公开于 https://yinyiluo.github.io/xLARD/。

关键词

引用

@article{arxiv.2603.24965,
  title  = {Self-Corrected Image Generation with Explainable Latent Rewards},
  author = {Yinyi Luo and Hrishikesh Gokhale and Marios Savvides and Jindong Wang and Shengfeng He},
  journal= {arXiv preprint arXiv:2603.24965},
  year   = {2026}
}

备注

CVPR 2026