基于双层扩散策略优化的修辞文本到图像生成
计算机视觉与模式识别
2025-08-12 v2
摘要
基于修辞语言的图像生成仍然是文本到图像模型面临的关键挑战。即使是最先进的(SOTA)多模态大语言模型(MLLM)也无法基于修辞语言中固有的隐含意义生成图像——尽管人类能够轻易地将此类内容映射为视觉表示。一个关键限制在于,当前模型强调对象级别的词嵌入对齐,导致隐喻表达将图像生成引向其字面视觉表象,从而忽略了预期的语义含义。为了解决这一问题,我们提出了 Rhet2Pix,这是一个将修辞文本到图像生成表述为多步策略优化问题并引入双层 MDP 扩散模块的框架。在外层,Rhet2Pix 将输入提示词转化为逐步细化的子句,并执行相应的图像生成动作,从而构建语义更丰富的视觉图像。在内层,Rhet2Pix 通过折现最终奖励并优化扩散去噪轨迹上的每一对相邻动作,缓解了图像生成过程中的奖励稀疏问题。大量实验证明了 Rhet2Pix 在修辞文本到图像生成中的有效性。在定性和定量评估中,我们的模型均优于 GPT-4o、Grok-3 等 SOTA MLLM 以及领先的学术基线。本工作所使用的代码和数据集均已公开。
引用
@article{arxiv.2505.22792,
title = {Rhetorical Text-to-Image Generation via Two-layer Diffusion Policy Optimization},
author = {Yuxi Zhang and Yueting Li and Xinyu Du and Sibo Wang},
journal= {arXiv preprint arXiv:2505.22792},
year = {2025}
}