中文

基于内在自信奖励的文本到图像生成提升

计算机视觉与模式识别 2026-05-12 v3 人工智能

摘要

文本到图像生成驱动着 design、media 和 data augmentation 领域的内容创建。后训练(post-training)的文本到图像生成模型是提升 human preference alignment、factuality 和 aesthetics 的有前景之路。我们引入 SOLACE(Self-Originating LAtent Confidence Estimation),一种 post-training 框架,用内部自信信号取代外部 reward supervision:我们对模型自身的输出进行 re-noise,并衡量其恢复注入噪声的准确程度,将低恢复误差视为高自信。SOLACE 将此内在信号转换为用于 reinforcement learning 的标量 rewards,无需 external reward models、annotation 人员或 preference data。通过强化 high-confidence generations,SOLACE 在 composition generation、text rendering 和 text-image alignment 上实现持续性提升。将 SOLACE 与 external rewards 集成可实现互补性改进,同时缓解 reward hacking。

关键词

引用

@article{arxiv.2603.00918,
  title  = {Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards},
  author = {Seungwook Kim and Minsu Cho},
  journal= {arXiv preprint arXiv:2603.00918},
  year   = {2026}
}

备注

22 pages, accepted to CVPR 2026. Project page https://wookiekim.github.io/SOLACE/