中文

CoEmoGen:面向语义连贯性与可扩展性的情感图像内容生成

计算机视觉与模式识别 2025-08-06 v1

摘要

情感图像内容生成(Emotional Image Content Generation, EICG)旨在根据给定情感类别生成语义明确且情感忠实的图像,具有广泛的应用前景。虽然最近的文本到图像扩散模型在生成具体概念方面表现出色,但在处理抽象情感的复杂性方面仍存在困难。此外,专为 EICG 设计的方法也过度依赖词级别属性标签进行引导,导致语义不连贯、歧义性强且可扩展性有限。为此,我们提出 CoEmoGen,一种具有语义连贯性和高可扩展性的新型管线。具体而言,利用多模态大语言模型(Multimodal Large Language Models, MLLMs),构建以情感触发内容为焦点的高质量标题,以实现上下文丰富的语义引导。进一步地,灵感来源于心理学,我们设计了层次化低秩适配(Hierarchical Low-Rank Adaptation, HiLoRA)模块,以协同建模 polarity 共享的低层特征和情感特定的高层语义。大量实验表明,CoEmoGen 在情感忠实性和语义连贯性方面均优于现有方法,实验结果从定量、定性以及用户研究三个角度均证明了其优势。为直观展示可扩展性,我们构建了 EmoArt 数据集,包含大量具有情感感染力的艺术图像,为情感驱动的艺术创作提供源源不断的灵感。数据集和代码已发布于 https://github.com/yuankaishen2001/CoEmoGen。

关键词

引用

@article{arxiv.2508.03535,
  title  = {CoEmoGen: Towards Semantically-Coherent and Scalable Emotional Image Content Generation},
  author = {Kaishen Yuan and Yuting Zhang and Shang Gao and Yijie Zhu and Wenshuo Chen and Yutao Yue},
  journal= {arXiv preprint arXiv:2508.03535},
  year   = {2025}
}

备注

10 pages, 9 figures