EmotiCrafter:基于效价-唤醒度模型的文本到情绪图像生成
计算机视觉与模式识别
2026-01-01 v3
摘要
最近的研究表明,情绪可以增强用户的认知并影响信息交流。虽然视觉情绪分析的研究很广泛,但在帮助用户生成情绪丰富的图像内容方面所做的工作有限。现有的情绪图像生成工作依赖于离散的情绪类别,这使得准确捕捉复杂和微妙的情绪差异具有挑战性。此外,这些方法难以根据文本提示控制生成图像的具体内容。在这项工作中,我们引入了连续情绪图像内容生成(C-EICG)的新任务,并提出了 EmotiCrafter,这是一种根据文本提示和效价-唤醒度值生成图像的情绪图像生成模型。具体而言,我们提出了一种新颖的情绪嵌入映射网络,将效价-唤醒度值嵌入到文本特征中,从而能够根据预期的输入提示捕捉特定情绪。此外,我们引入了一个损失函数来增强情绪表达。实验结果表明,我们的方法能有效地生成具有所需内容且代表特定情绪的图像,并优于现有技术。
引用
@article{arxiv.2501.05710,
title = {EmotiCrafter: Text-to-Emotional-Image Generation based on Valence-Arousal Model},
author = {Shengqi Dang and Yi He and Long Ling and Ziqing Qian and Nanxuan Zhao and Nan Cao},
journal= {arXiv preprint arXiv:2501.05710},
year = {2026}
}
备注
11 pages, 10 figures