中文

像素中的诗意:基于扩散模型的诗歌图像生成提示微调

计算机视觉与模式识别 2025-01-13 v1

摘要

文本到图像生成任务在应用于文学作品(尤其是诗歌)时遇到了重大挑战。诗歌是一种独特的文学形式,其含义常常超越字面意义。为解决这一不足,我们提出了PoemToPixel框架,旨在生成能够视觉化呈现诗歌内在含义的图像。我们的方法在图像生成框架中引入了提示微调的概念,以确保生成的图像与诗歌内容紧密对齐。此外,我们提出了PoeKey算法,该算法从诗歌中提取情感、视觉元素和主题三种关键要素,形成指令,随后提供给扩散模型以生成相应图像。为了扩展诗歌数据集在不同体裁和年代上的多样性,我们引入了MiniPo,一个包含1001首儿童诗歌和图像的新型多模态数据集。利用该数据集以及PoemSum,我们对使用PoemToPixel框架生成的图像进行了定量和定性评估。本文展示了我们方法的有效性,并为从文学来源生成图像提供了新的视角。

关键词

引用

@article{arxiv.2501.05839,
  title  = {Poetry in Pixels: Prompt Tuning for Poem Image Generation via Diffusion Models},
  author = {Sofia Jamil and Bollampalli Areen Reddy and Raghvendra Kumar and Sriparna Saha and K J Joseph and Koustava Goswami},
  journal= {arXiv preprint arXiv:2501.05839},
  year   = {2025}
}