中文

MUSE:基于测试时优化的情感图像合成统一框架

计算机视觉与模式识别 2025-11-27 v1

摘要

图像唤起的情感对感知影响深远,往往优先于内容。当前的图像情感合成(IES)方法人为地将生成和编辑任务分离,导致效率低下,并限制了这些任务自然交织的应用场景,如治疗干预或叙事。本文介绍 MUSE,即首个能够实现情感生成和编辑的统一框架。通过采用概念上与测试时扩展(TTS)一致的策略,这一方法在 LLM 和扩散模型社区中广泛使用,无需额外更新扩散模型或专用情感合成数据集。更具体地,MUSE 解决了情感合成中的三个关键问题:(1)如何通过利用基于情感分类器的梯度优化情感标记来稳定引导合成;(2)何时引入情感引导通过将语义相似性作为监督信号识别最佳时机;(3)选择哪种情感通过多情感损失减少固有和相似情感的干扰。实验结果表明,MUSE 在生成和编辑任务中均优于所有方法,在提升情感准确性和语义多样性方面,同时保持所需内容、文本提示遵循性和真实情感表达之间的最佳平衡。它建立了情感合成的新范式。

关键词

引用

@article{arxiv.2511.21051,
  title  = {MUSE: Manipulating Unified Framework for Synthesizing Emotions in Images via Test-Time Optimization},
  author = {Yingjie Xia and Xi Wang and Jinglei Shi and Vicky Kalogeiton and Jian Yang},
  journal= {arXiv preprint arXiv:2511.21051},
  year   = {2025}
}