基于语义感知空间加权的自创性文本到对象生成
计算机视觉与模式识别
2026-05-20 v1
摘要
为文本到图像(T2I)生成注入创造力具有显著挑战,因为合成图像需同时具备视觉新颖性与艺术价值。当前 T2I 模型主要针对字面文本-图像对齐优化,其噪声预测网络约束生成位于高概率区域,从而导致输出缺乏真正的创造性。为此,我们提出一种 Self-Creative Diffusion (SCDiff) 模型,用于实现有意义的 T2I 生成,包含两个核心模块:可学习空间加权(LSW)模块和视觉-语义混合损失(VSML)。LSW 模块设计参数 Kaiser-Bessel 窗,以强化中心图像特征,促进新颖和出人意料的生成。VSML 模块引入双重损失函数:相似性损失约束新图像与其文本描述的对齐,多样性损失最大化其与原图的差异,提升语义价值与视觉新颖性。大量实验表明,该模型在创造力、语义对齐与视觉连贯性方面均显著提升,提供了一种简单而强大的创造性对象生成框架。
引用
@article{arxiv.2605.19554,
title = {Self-Creative Text-to-Object Generation using Semantic-Aware Spatial Weighting},
author = {Yue Yu and Haibo Chen and Shuo Chen and Jian Yang and Jun Li},
journal= {arXiv preprint arXiv:2605.19554},
year = {2026}
}