中文

EmoScene:用于可控情感图像生成的双空间数据集

计算机视觉与模式识别 2026-04-02 v1

摘要

文本到图像扩散模型在实现高视觉保真度方面取得了显著进展,但对场景语义和细粒度情感语调的精确控制仍然具有挑战性。人类视觉情感源于情境意义(包括价值、 arousal 和支配性)与感知线索(如色彩和谐、亮度对比、纹理变化、曲率和空间布局)的快速整合。然而,当前的文本到图像模型很少在统一表示中包含情感和感知因素,这限制了其合成具有连贯性和细腻情感意图的场景的能力。为解决这一问题,我们构建了 EmoScene,一个大规模双空间情感数据集,联合编码情感维度和感知属性,并提供情境语义作为支持性注释。EmoScene 包含超过 300 个真实场景类别的 120 万张图片,每张图片都标注了离散情感标签、连续的 VAD 值、感知描述符和文本描述。多空间分析揭示了离散情感在 VAD 空间中的分布情况,以及情感如何系统性地与场景级感知因素相关联。为基准评估 EmoScene,我们提供了一个轻量级参考基线,通过浅层跨注意力调制将双空间控制注入冻结的扩散模型主干,作为双空间监督下情感可控性的可复现探针。

关键词

引用

@article{arxiv.2604.00933,
  title  = {EmoScene: A Dual-space Dataset for Controllable Affective Image Generation},
  author = {Li He and Longtai Zhang and Wenqiang Zhang and Yan Wang and Lizhe Qi},
  journal= {arXiv preprint arXiv:2604.00933},
  year   = {2026}
}