中文

利用文本到图像扩散模型阐释经典巴西书籍

人工智能 2024-08-02 v1

摘要

近年来,生成式人工智能(GenAI)在处理涉及多种模态的复杂任务(如文本、听觉、视觉和绘图生成)方面经历了深远变革。在这一范畴内,文本到图像(TTI)模型已成为一种强大的生成方法,能够制造多样且富有审美的构图,涵盖从艺术创作到逼真面部合成等应用,并在计算机视觉、图像处理和多模态任务中取得显著进展。潜在扩散模型(LDMs)的出现标志着AI能力范式的转变。本文探讨了采用 Stable Diffusion LDM 来阐释文学作品的可行性。为此探索,选取了七本经典巴西书籍作为案例研究。旨在确定这一举措的可行性,并评估Stable Diffusion 在产生增强和丰富读者体验的插图方面的潜力。我们将概述其有益方面,如生成独特且与上下文相关的图像的能力,以及缺点,包括在忠实地捕捉复杂文学描绘的方面存在的不足。通过本研究,我们旨在为在文学语境中利用AI生成插图的可行性和有效性提供全面评估,阐明在这一技术 pioneering 应用中遇到的前景和挑战。

关键词

引用

@article{arxiv.2408.00544,
  title  = {Illustrating Classic Brazilian Books using a Text-To-Image Diffusion Model},
  author = {Felipe Mahlow and André Felipe Zanella and William Alberto Cruz Castañeda and Regilene Aparecida Sarzi-Ribeiro},
  journal= {arXiv preprint arXiv:2408.00544},
  year   = {2024}
}

备注

7 pages, 2 figures