探究扩散模型的概念混合以改进非词到图像生成
多媒体
2024-11-07 v1
摘要
文本到图像扩散模型有时会在生成的图像中描绘混合概念。这一效应的一个有前景的用例是非词到图像生成任务,该任务试图从不存在于语言中的词(非词)直观地生成图像。为了实现非词到图像生成,已有研究专注于将非词与发音相似的词进行关联。由于每个非词可以有多个发音相似的词,生成包含它们混合概念的图像会增加直观性,从而促进创造性活动并推动计算心理语言学。然而,尚无现有研究在扩散模型或非词到图像生成范式中定量评估这一效应。因此,本文首先分析了预训练扩散模型 Stable Diffusion 中的概念混合。分析表明,当输入两个指代不同概念的文本提示词的文本嵌入之间的插值时,有很高比例的生成图像描绘了混合概念。接下来,本文探讨了现有非词到图像生成框架的最佳文本嵌入空间转换方法,以确保概念混合的出现和图像生成质量。我们比较了传统的直接预测方法与所提出的结合 k 近邻搜索和线性回归的方法。评估结果表明,所提出的方法提高了嵌入空间转换的准确性,从而改善了图像生成质量,而概念混合的出现主要归因于高维文本嵌入空间的特定维度。
引用
@article{arxiv.2411.03595,
title = {Investigating Conceptual Blending of a Diffusion Model for Improving Nonword-to-Image Generation},
author = {Chihaya Matsuhira and Marc A. Kastner and Takahiro Komamizu and Takatsugu Hirayama and Ichiro Ide},
journal= {arXiv preprint arXiv:2411.03595},
year = {2024}
}
备注
Paper accepted at ACM MM 2024 (doi: 10.1145/3664647.3681202) with supplementary materials concatenated