中文

诗歌叙事扩散模型:通过多阶段提示优化最小化诗歌到图像生成中的信息损失

计算机视觉与模式识别 2025-07-24 v2

摘要

最近的文本到图像扩散模型在生成逼真且多样化视觉内容方面取得了显著进展。其关键因素在于模型准确解释文本提示的能力。然而,这些模型常常在处理富有创意的表达时,尤其是涉及复杂、抽象或高度描述性语言时,难以掌握。本文提出一种无训练的创新方法,旨在改进针对独特创意语言——诗歌诗句的图像生成。我们的 PoemTale Diffusion 方法旨在通过整合多阶段提示优化循环到语言模型中,从而最小化诗歌文本到图像转换期间的信息损失。为支持这一目标,我们改造现有的领先扩散模型,修改其自注意力机制以采用一致的自注意力技术,生成多个一致的图像,这些图像随后被用于传达诗歌含义。此外,为鼓励该领域的研究,我们引入了 P4I (PoemForImage) 数据集,包含 1111 首诗歌,来源于多个线上线下资源。我们邀请了诗歌专家进行定性评估。通过人类和量化评估的结果表明,我们的方法有效果,为诗歌到图像生成提供了新的视角,实现了对生成图像中信息的增强捕获。

关键词

引用

@article{arxiv.2507.13708,
  title  = {PoemTale Diffusion: Minimising Information Loss in Poem to Image Generation with Multi-Stage Prompt Refinement},
  author = {Sofia Jamil and Bollampalli Areen Reddy and Raghvendra Kumar and Sriparna Saha and Koustava Goswami and K. J. Joseph},
  journal= {arXiv preprint arXiv:2507.13708},
  year   = {2025}
}

备注

ECAI 2025