中文

EmoLat:通过情感潜在空间进行文本驱动的图像情感迁移

计算机视觉与模式识别 2026-01-21 v1

摘要

我们提出了 EmoLat,一种新颖的情感潜在空间,通过建模文本语义与视觉情感特征之间的跨模态关联,实现细粒度、文本驱动的图像情感迁移。在 EmoLat 内部,构建了一个情感语义图来捕捉情感、物体和视觉属性之间的关系结构。为了增强情感表征的判别性和可迁移性,我们采用了对抗正则化,对齐跨模态的潜在情感分布。基于 EmoLat,我们提出了一种跨模态情感迁移框架,通过文本和 EmoLat 特征的联合嵌入来操控图像情感。该网络使用包含语义一致性、情感对齐和对抗正则化的多目标损失进行优化。为了支持有效建模,我们构建了 EmoSpace Set,这是一个大规模基准数据集,包含带有情感、物体语义和视觉属性密集标注的图像。在 EmoSpace Set 上的大量实验表明,我们的方法在定量指标和定性迁移保真度上均显著优于现有最先进的方法,为文本输入引导的可控图像情感编辑建立了新范式。EmoSpace Set 和所有代码均可在 http://github.com/JingVIPLab/EmoLat 获取。

关键词

引用

@article{arxiv.2601.12079,
  title  = {EmoLat: Text-driven Image Sentiment Transfer via Emotion Latent Space},
  author = {Jing Zhang and Bingjie Fan and Jixiang Zhu and Zhe Wang},
  journal= {arXiv preprint arXiv:2601.12079},
  year   = {2026}
}

备注

10 pages, 5 figures