中文

MooD:基于连续价值- arousal 模型的感知增强高效情感图像编辑

计算机视觉与模式识别 2026-05-14 v2

摘要

情感图像编辑(Affective Image Editing, AIE)旨在修改视觉内容以唤起特定情绪。虽然当前方法在编辑质量方面取得了令人印象深刻的成果,但它们往往忽视推理效率,这限制了其在计算社交场景中的应用。此外,大多数方法依赖离散情感表征,这会阻碍对复杂人类情绪的连续建模,并限制了交互场景中的表达能力。为解决这些问题,我们提出了 MooD 框架——首个直接利用连续价值- arousal(Valence-Arousal, VA)值作为编辑指令,以实现计算社交系统中细粒度且高效 AIE 的框架。具体而言,我们首先引入 VA 感知检索策略,以桥接模糊的情感值与详细的视觉语义。基于此,MooD 集成了视觉迁移和感知增强语义指导,以实现可控的 AIE。此外,考虑到现有 VA 标注数据集主要聚焦于社交场景,大量忽视自然场景,我们因此构建了 AffectSet——一个涵盖多样场景的全面 VA 标注数据集,以支持模型优化与评估。大量定性和定量实验结果表明,MooD 在情感可控性和视觉保真度方面均实现卓越性能,同时保持高效能。一系列消融研究进一步揭示了我们设计的关键因素。

关键词

引用

@article{arxiv.2605.02521,
  title  = {MooD: Perception-Enhanced Efficient Affective Image Editing via Continuous Valence-Arousal Modeling},
  author = {Xinyi Yin and Yiduo Wang and Tingqi Hu and Meicong Si and Yunyun Shi and Shi Chen and Hao Wang and Junxiao Xue and Xuecheng Wu},
  journal= {arXiv preprint arXiv:2605.02521},
  year   = {2026}
}