LeX-Art:通过可扩展高质量数据合成重新思考文本生成
计算机视觉与模式识别
2025-03-28 v1
摘要
我们引入 LeX-Art,一个为高质量文本-图像合成而构建的综合性套件,系统性地弥合提示表达性与文本渲染保真度之间的差距。我们的做法遵循数据中心方法论,基于 Deepseek-R1 构建了高质量数据合成管道,以 curated LeX-10K 数据集,包含 10K 张分辨率为1024×1024像素的高质量、审美精细的图像。除数据集构建外,我们开发了 LeX-Enhancer 强鲁棒提示词增强模型,并训练了两个文本到图像模型 LeX-FLUX 和 LeX-Lumina,实现了业界领先的文本渲染性能。为系统评估视觉文本生成,我们引入 LeX-Bench 基准,评估保真度、审美与对齐度,并辅以 Pairwise Normalized Edit Distance (PNED) 用于稳健的文本准确度评估。实验表明显著提升,LeX-Lumina 在 CreateBench 上的 PNED 提升达79.81%,LeX-FLUX 在颜色(+3.18%)、位置(+4.45%)和字体准确度(+3.81%)方面超越基线。我们的代码、模型、数据集和演示均已公开。
引用
@article{arxiv.2503.21749,
title = {LeX-Art: Rethinking Text Generation via Scalable High-Quality Data Synthesis},
author = {Shitian Zhao and Qilong Wu and Xinyue Li and Bo Zhang and Ming Li and Qi Qin and Dongyang Liu and Kaipeng Zhang and Hongsheng Li and Yu Qiao and Peng Gao and Bin Fu and Zhen Li},
journal= {arXiv preprint arXiv:2503.21749},
year = {2025}
}
备注
Project page: https://zhaoshitian.github.io/lexart/