中文

生成艺术中的金融模型:文本到图像扩散中受Black-Scholes启发的概念融合

计算机视觉与模式识别 2025-04-15 v2

摘要

我们提出了一种新颖的方法,用于预训练文本到图像扩散模型中的概念融合,旨在生成位于多个文本提示交集处的图像。在扩散去噪的每个时间步,我们的算法预测关于生成图像的预测,并做出明智的文本条件决策。我们方法的核心是扩散模型(根植于非平衡热力学)与金融期权定价的Black-Scholes模型之间的独特类比。通过绘制两个领域中关键变量的平行关系,我们推导出一个鲁棒的概念融合算法,该算法利用了Black-Scholes框架的马尔可夫动力学。我们的基于文本的概念融合算法是数据高效的,意味着它不需要额外训练。此外,它无需人工干预或超参数调优。我们通过定性和定量比较与其他基于文本的概念融合技术(包括线性插值、交替提示、逐步提示切换和CLIP引导的提示选择)在各种场景(如每个文本提示单个对象、每个文本提示多个对象以及对象与背景)下的表现,突出了我们方法的优势。我们的工作表明,金融启发的技术可以增强生成式AI中的文本到图像概念融合,为更广泛的创新铺平道路。代码可在https://github.com/divyakraman/BlackScholesDiffusion2024获取。

关键词

引用

@article{arxiv.2405.13685,
  title  = {Financial Models in Generative Art: Black-Scholes-Inspired Concept Blending in Text-to-Image Diffusion},
  author = {Divya Kothandaraman and Ming Lin and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2405.13685},
  year   = {2025}
}