心之眼:引导视觉隐喻生成的多维奖励框架
计算与语言
2025-08-27 v1 计算机视觉与模式识别
摘要
视觉隐喻生成是一个具有挑战性的任务,旨在给定输入文本隐喻生成图像。其内在需求在于语言理解,将 source concept 与 target concept 绑定,方式既要保留意义,又要确保视觉连贯性。我们提出了聚焦于隐喻对齐的自评估视觉隐喻生成框架。我们的自评估方法结合现有指标与我们新提出的隐喻分解得分和意义对齐(MA)指标。在此框架下,我们探讨了两种新方法:一种训练自由的管道显式地将提示分解为 source-target-meaning(S-T-M)映射用于图像合成,另一种补充的训练式管道则通过我们提出的自评估奖励模式改进对齐,无需大规模重新训练。在 held-out 测试集上,训练自由方法在分解、CLIP 和 MA 得分方面均优于强大的闭源基线(如 GPT-4o、Imagen),而训练式方法紧随其后。我们对框架输出进行了用户导向的研究,发现受试者总体上偏好 GPT-4o,而我们的训练自由管道在开源方法中领先,并在抽象隐喻上略胜于 Imagen。我们的分析表明,S-T-M 提示对较长或更抽象的隐喻有帮助,闭源模型在短小具体的案例中表现更佳;我们还观察到对采样器设置的敏感性。总体而言,结构化提示和轻量级强化学习在有限计算资源下能够较好地完成隐喻对齐,剩余与人类偏好的差距似乎由审美和采样因素驱动。
引用
@article{arxiv.2508.18569,
title = {The Mind's Eye: A Multi-Faceted Reward Framework for Guiding Visual Metaphor Generation},
author = {Girish A. Koushik and Fatemeh Nazarieh and Katherine Birch and Shenbin Qian and Diptesh Kanojia},
journal= {arXiv preprint arXiv:2508.18569},
year = {2025}
}
备注
Under Review