TextAlign:基于层次奖励的文本渲染偏好对齐
计算机视觉与模式识别
2026-05-20 v1 数据库
摘要
忠实的文本渲染仍是大型文本到图像生成模型的持久弱点,因为它需要语义指令遵循和细粒度字形结构。先前方法常通过特定于架构的模块或编码器修改来提升此能力,这会复杂化跨基础模型的部署。我们将文本渲染视为后训练偏好对齐问题,提出 TextAlign,一种保持生成器架构不变的非侵入式框架。关键组件是基于层次化视觉语言模型(VLM)的奖励,将渲染错误分解为全局、单词和字形层级,然后将二元缺陷判断转换为标量偏好信号。该信号支持 Group Relative Policy Optimization(GRPO)和 Direct Preference Optimization(DPO)。在 FLUX.1-dev 和 Z-Image-Turbo 上的实验表明,OCR 基于文本准确率 consistently 提升,而不损害一般生成质量。与强大的基础模型和文本渲染基线(包括 SD3.5、Qwen-Image、AnyText 和 TextDiffuser)相比,这些结果表明,奖励设计为改善文本渲染提供了可扩展的模型重新设计替代方案。
引用
@article{arxiv.2605.19320,
title = {TextAlign: Preference Alignment for Text Rendering with Hierarchical Rewards},
author = {Mingxuan Cui and Jingpu Yang and Fengxian Ji and Qian Jiang and Zhecheng Shi and Jiaming Wang and Zirui Song and Fajri Koto and Xiuying Chen},
journal= {arXiv preprint arXiv:2605.19320},
year = {2026}
}