中文

EmoAgent:面向多样化情感图像编辑的多智能体框架

计算机视觉与模式识别 2025-06-24 v3 图像与视频处理

摘要

情感图像编辑旨在改变图像中的视觉元素,以唤起观者的特定情感反应。然而,现有的 AIM 方法依赖于情感与视觉线索之间僵化的一对一映射,使其难以适应人类感知与表达情感时固有的主观性与多样性。为解决此问题,我们引入了一种称为多样化情感图像编辑的新任务设置,旨在从单张源图像和目标情感出发,生成多幅视觉上不同但情感上一致的图像编辑结果。我们提出了 EmoAgent,这是首个专为 D-AIM 设计的多智能体框架。EmoAgent 将编辑过程显式分解为由协作智能体执行的三个专门阶段:生成多样化情感编辑策略的规划智能体、精确执行这些策略的编辑智能体,以及迭代优化结果以确保情感准确性的评论智能体。这种协作设计使 EmoAgent 能够建模一对多的情感到视觉映射,从而实现语义上多样化且情感上忠实的编辑。大量的定量与定性评估表明,EmoAgent 在情感保真度和语义多样性上均显著优于现有方法,能够有效生成多幅传达相同目标情感的截然不同的视觉编辑结果。

关键词

引用

@article{arxiv.2503.11290,
  title  = {EmoAgent: A Multi-Agent Framework for Diverse Affective Image Manipulation},
  author = {Qi Mao and Haobo Hu and Yujie He and Difei Gao and Haokun Chen and Libiao Jin},
  journal= {arXiv preprint arXiv:2503.11290},
  year   = {2025}
}