EmoKGEdit:基于视觉线索变换的无训练情感注入
计算机视觉与模式识别
2026-01-21 v1
摘要
现有的图像情感编辑方法难以从潜在内容表示中解耦情感线索,常常导致情感表达微弱和视觉结构扭曲。为了弥补这一差距,我们提出了EmoKGEdit,一种用于精确且保持结构的图像情感编辑的新型无训练框架。具体来说,我们构建了一个多模态情感关联知识图谱(MSA-KG)来解耦对象、场景、属性、视觉线索和情感之间的复杂关系。MSA-KG显式地编码了对象-属性-情感之间的因果链,并作为外部知识支持思维链推理,引导多模态大模型推断合理的情感相关视觉线索并生成连贯的指令。此外,基于MSA-KG,我们设计了一个解耦的结构-情感编辑模块,该模块在潜在空间中显式地将情感属性与布局特征分离,确保目标情感被有效注入,同时严格保持视觉空间一致性。大量实验表明,EmoKGEdit在情感保真度和内容保持方面均取得了优异的性能,并超越了最先进的方法。
引用
@article{arxiv.2601.12326,
title = {EmoKGEdit: Training-free Affective Injection via Visual Cue Transformation},
author = {Jing Zhang and Bingjie Fan},
journal= {arXiv preprint arXiv:2601.12326},
year = {2026}
}
备注
11pages,10figures