Moodifier:MLLM增强的情感驱动图像编辑
计算机视觉与模式识别
2025-07-21 v1
摘要
将情感与视觉内容相连接以进行情感驱动的图像编辑在创意产业中具有巨大潜力,但由于情感的抽象本质及其在不同情境下的多样表现,精确操控仍具挑战。我们采用包含三个互补组件的综合方法来应对这一挑战。首先,我们引入了 MoodArchive,这是一个包含 800 多万张图像的数据集,带有由 LLaVA 生成的详细分层情感标注,并部分由人工评估者验证。其次,我们开发了 MoodifyCLIP,这是一个在 MoodArchive 上微调的视觉-语言模型,用于将抽象情感转化为特定的视觉属性。第三,我们提出了 Moodifier,这是一个免训练的编辑模型,利用 MoodifyCLIP 和多模态大语言模型 (MLLM) 实现精确的情感转换,同时保持内容完整性。我们的系统适用于角色表情、时尚设计、珠宝和家居装饰等不同领域,使创作者能够在保持身份和结构的同时快速可视化情感变化。广泛的实验评估表明,Moodifier 在情感准确性和内容保持方面均优于现有方法,提供了符合语境的编辑。通过将抽象情感与具体的视觉变化联系起来,我们的解决方案为现实应用中的情感内容创作解锁了新的可能性。论文被接受后,我们将发布 MoodArchive 数据集、MoodifyCLIP 模型,并公开 Moodifier 的代码和演示。
引用
@article{arxiv.2507.14024,
title = {Moodifier: MLLM-Enhanced Emotion-Driven Image Editing},
author = {Jiarong Ye and Sharon X. Huang},
journal= {arXiv preprint arXiv:2507.14024},
year = {2025}
}