GlyphMastero:用于高保真场景文本编辑的表意符号编码器
计算机视觉与模式识别
2025-05-09 v1
摘要
场景文本编辑是图像编辑的一个子领域,需要在保持风格一致性和与周围环境的视觉连贯性的同时修改图像中的文本。虽然扩散基于的方法在文本生成方面显示出前景,但仍难以产生高质量的结果。这些方法常常生成变形或无法识别的字符,尤其是在处理复杂字符(如中文)时。对于这些系统,字符由复杂的笔画模式和空间关系组成,这些笔画模式和空间关系必须被精确地保持。我们提出 GlyphMastero,一个专门的表意符号编码器,用于指导潜在扩散模型以笔画水平精确生成文本。我们的关键洞察是,尽管使用预训练 OCR 模型进行特征提取,但现有方法仍未捕捉文本结构的层次性——从单个笔画到笔画级别的交互再到整体字符级别的结构。为此,我们的表意符号编码器通过我们新颖的表意符号注意力模块显式建模和捕捉局部级别单个字符与全局级别文本行之间的跨层次交互。同时,我们的模型在全局级别实现特征金字塔网络,以融合多尺度 OCR 主干特征。通过这些跨层次和多尺度融合,我们获得更详细的表意符号感知指导,使我们能够对场景文本生成过程实现精确控制。我们的方法在句子准确率上比当前最好的多语言场景文本编辑基线提升了 18.02%,同时将文本区域 Frenchet 意象距离降低了 53.28%。
引用
@article{arxiv.2505.04915,
title = {GlyphMastero: A Glyph Encoder for High-Fidelity Scene Text Editing},
author = {Tong Wang and Ting Liu and Xiaochao Qu and Chengjing Wu and Luoqi Liu and Xiaolin Hu},
journal= {arXiv preprint arXiv:2505.04915},
year = {2025}
}
备注
CVPR 2025