中文

EmoStyle:风格专家专家的情感条件化用于情感图像生成

计算机视觉与模式识别 2026-07-11 v1 人工智能

摘要

情感感知的艺术图像生成要求图像匹配输入提示、遵循指定的艺术风格并传达目标情感。在这个挑战中,主要困难在于训练数据中可用的视觉和情感属性在测试时并未明确提供。没有这些属性,生成器不仅需要决定描绘什么,还需要决定如何通过颜色、光照、笔触、构图、线条和布局来表达目标情感。这在可用的测试提示和情感感知艺术生成所需的细粒度条件之间造成了控制差距。为了弥合这一差距,我们提出了 EmoStyle,一个基于 Z-Image 的框架,将输入提示转换为结构化的生成状态。一个 LLM 推理器首先预测情感线索(效价-唤醒度、主导情感和治疗效果标签)和宽高比决策。我们不仅将这些预测用作额外的提示文本,而是将情感字段编码为情感条件向量,并通过 AdaLN 风格的调制将其注入去噪块。这允许推断的控制变量直接指导中间特征的生成。由于情感表达也依赖于风格,我们进一步为每个艺术风格桶训练一个专用的 LoRA 适配器,并在推理期间选择相应的专家,使得相同的情感线索能够以特定于桶的颜色、纹理、笔触和构图先验进行渲染。最后,一个轻量级的 VLM 引导的候选选择步骤根据提示对齐、风格一致性、情感表达和视觉质量对生成的图像进行排名。在 AffectiveArt Challenge 2026 的 Track 1 中,我们的 USTC\_PI\_LAB\_TEAM 提交获得了第一名。

关键词

引用

@article{arxiv.2607.10165,
  title  = {EmoStyle: Affective Conditioning of Style-Specialist Experts for Emotional Image Generation},
  author = {Dexiang Hong and Yijie Guo and Weidong Chen and Xinyan Liu and Zixuan Zou and Zhendong Mao and Yongdong Zhang},
  journal= {arXiv preprint arXiv:2607.10165},
  year   = {2026}
}