LogoDiffuser:基于字母感知注意力控制的无训练多语言 Logo 生成与风格化
计算机视觉与模式识别
2026-03-11 v1
摘要
近期文本到图像生成技术取得显著进展,但生成能够和谐融合视觉与文本元素的多语言设计 Logo 仍具挑战性。现有方法常在应用创意风格时扭曲字符几何,且难以支持多语言文本生成而无需额外训练。为此,我们提出 LogoDiffuser,一种无训练方法,通过多模态扩散转换器合成多语言 Logo 设计。不同于使用文本提示,我们将目标字符作为图像输入,从而实现对字符结构的稳健控制,无论语言为何。我们首先分析联合注意力机制,识别核心 token——这些 token 对文本结构反应尤强。基于此,我们将字符结构与视觉设计相结合,通过注入最具信息量的注意力图实现整合。进一步进行注意力图的层级聚合,以缓解跨层注意力偏移,获取一致的核心 token。大量实验与用户研究表明,我们的方法在多语言 Logo 生成方面达到最新技术水平。
引用
@article{arxiv.2603.09759,
title = {LogoDiffuser: Training-Free Multilingual Logo Generation and Stylization via Letter-Aware Attention Control},
author = {Mingyu Kang and Hyein Seo and Yuna Jeong and Junhyeong Park and Yong Suk Choi},
journal= {arXiv preprint arXiv:2603.09759},
year = {2026}
}