GlyphPrinter:基于区域分组直接偏好优化的字形精准视觉文本渲染
计算机视觉与模式识别
2026-03-17 v1
摘要
生成视觉文本渲染中准确的字形是关键且具挑战性的。现有方法通常通过在大量高质量场景文本图像上训练来增强文本渲染,但字形变体的覆盖有限且过度风格化常会损害字形准确性,尤其是针对复杂或跨域字符。某些方法利用强化学习来缓解此问题,但其奖励模型通常依赖对细粒度字形错误不敏感的文本识别系统,以致错误字形的图像仍可能获得高奖励。灵感来自直接偏好优化(DPO),我们提出GlyphPrinter,一种消除对显式奖励模型依赖的偏好型文本渲染方法。然而,标准DPO目标仅建模两个样本之间的整体偏好,这对于文本渲染中的字形错误通常发生在局部区域的情况而言不够。为此,我们构建了带有区域级字形偏好注释的GlyphCorrector数据集,并提出区域分组DPO(R-GDPO),一种基于区域的目标函数,可在标注区域上优化样本间和样本内部偏好,显著提升字形准确性。此外,我们引入区域奖励引导,一种推理策略,从最优分布中进行采样,可控制字形准确性。广泛的实验表明,所提GlyphPrinter在字形准确性方面优于现有方法,同时在风格化与精确度之间保持良好平衡。
引用
@article{arxiv.2603.15616,
title = {GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering},
author = {Xincheng Shuai and Ziye Li and Henghui Ding and Dacheng Tao},
journal= {arXiv preprint arXiv:2603.15616},
year = {2026}
}
备注
CVPR 2026, Project Page: https://henghuiding.com/GlyphPrinter/