FLUX-Text:一个用于场景文本编辑的简单且先进的扩散Transformer基线
计算机视觉与模式识别
2025-11-21 v4
摘要
场景文本编辑旨在修改或添加图像上的文本,同时确保文本保真度以及与背景一致的整体视觉质量。最近的方法主要建立在基于UNet的扩散模型之上,这些模型改善了场景文本编辑的结果,但在处理复杂字形结构时仍然面临困难,尤其是对于非拉丁文字(例如,中文、韩文、日文)。为了解决这些问题,我们提出了FLUX-Text,一种简单且先进的多语言场景文本编辑DiT方法。具体来说,我们的FLUX-Text通过轻量级的视觉和文本嵌入模块增强了对字形的理解和生成能力,同时保留了FLUX的原始生成能力。我们进一步提出了一种针对文本区域的区域文本感知损失,以及一个匹配的两阶段训练策略,以更好地平衡文本编辑和整体图像质量。得益于基于DiT的架构和轻量级特征注入模块,FLUX-Text仅需0.1M训练样本即可训练,与流行方法所需的2.9M相比减少了97%。在包括英文和中文基准在内的多个公共数据集上进行的大量实验表明,我们的方法在视觉质量和文本保真度方面均优于其他方法。所有代码可在https://github.com/AMAP-ML/FluxText获取。
引用
@article{arxiv.2505.03329,
title = {FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text Editing},
author = {Rui Lan and Yancheng Bai and Xu Duan and Mingxing Li and Dongyang Jin and Ryan Xu and Dong Nie and Lei Sun and Xiangxiang Chu},
journal= {arXiv preprint arXiv:2505.03329},
year = {2025}
}
备注
10 pages, 5 figures