中文

EmoFeedback$^2$: 基于 LVLM 的情感连续图像生成强化学习

计算机视觉与模式识别 2025-11-27 v2 人工智能

摘要

情感连续图像生成(C-EICG)正因其能够生成既符合用户描述又符合连续情感价值的图像而迅速发展。然而,现有方法缺乏来自生成图像的情感反馈,限制了情感连续性的控制。此外,这些方法简单地将情感与生成文本对齐,无法根据图像内容自适应调整情感提示,从而导致情感保真度不足。为此,我们提出一种新颖的生成-理解-反馈强化范式(EmoFeedback2^2),用于C-EICG,利用经过微调的大型视觉语言模型(LVLM)为生成高质量具有连续情感的图像提供奖励和文本反馈。具体而言,我们引入情感感知奖励反馈策略,其中LVLM评估生成图像的情感价值并计算与目标情感的奖励,从而引导生成模型的强化微调,增强图像的情感连续性。进一步,我们设计了自我提升文本反馈框架,LVLM在迭代分析生成图像的情感内容后,自适应生成下一轮提示的细化建议,提高与细粒度内容相关的情感保真度。大量实验结果表明,我们的方法有效地生成符合预期情感的高质量图像,在自定义数据集上 outperform 现有最先进的方法。代码和数据集将很快公开。

关键词

引用

@article{arxiv.2511.19982,
  title  = {EmoFeedback$^2$: Reinforcement of Continuous Emotional Image Generation via LVLM-based Reward and Textual Feedback},
  author = {Jingyang Jia and Kai Shu and Gang Yang and Long Xing and Xun Chen and Aiping Liu},
  journal= {arXiv preprint arXiv:2511.19982},
  year   = {2025}
}