中文

AIM-Bench:通过细粒度分层控制进行情感图像操作的基准测试与改进

计算机视觉与模式识别 2026-04-14 v1

摘要

情感图像操作(AIM)旨在通过有针对性的编辑来唤起特定情感。当前的图像编辑基准主要关注通用场景中的对象级修改,缺乏捕捉情感维度的细粒度。为了弥补这一差距,我们引入了第一个专为AIM设计的基准,称为AIM-Bench。该基准建立在一个双路径情感建模方案之上,该方案将Mikels情感分类法与效价-唤醒-支配框架相结合,实现了高层语义和细粒度连续操作。通过分层的人机协同工作流程,我们最终整理了800个高质量样本,涵盖8个情感类别和5种编辑类型。为了有效评估性能,我们还设计了一个结合了基于规则和基于模型的指标的综合评估套件,以全面评估指令一致性、美学和情感表现力。广泛的评估表明,当前的编辑模型面临着重大挑战,最显著的是普遍存在的正向偏差,这源于训练数据分布中固有的不平衡。为了解决这个问题,我们提出了一种可扩展的数据引擎,利用反向重绘策略构建了AIM-40k,一个包含40k样本的平衡指令微调数据集。具体来说,我们通过生成式重绘来增强原始情感图像,以建立高保真度的真实数据,并合成具有不同情感的输入图像和配对的精确指令。在AIM-40k上微调基线模型,整体性能相对提升了9.15%,证明了我们AIM-40k的有效性。我们的数据和相关代码将很快开源。

关键词

引用

@article{arxiv.2604.10454,
  title  = {AIM-Bench: Benchmarking and Improving Affective Image Manipulation via Fine-Grained Hierarchical Control},
  author = {Shi Chen and Xuecheng Wu and Heli Sun and Yunyun Shi and Xinyi Yin and Fengjian Xue and Jinheng Xie and Dingkang Yang and Hao Wang and Junxiao Xue and Liang He},
  journal= {arXiv preprint arXiv:2604.10454},
  year   = {2026}
}