基于字形先验和注意力引导的无训练遮挡文本渲染
计算机视觉与模式识别
2026-05-19 v1
摘要
我们提出了一个针对遮挡文本渲染的无训练框架,采用预训练的FLUX.1-dev backbone。该任务要求模型渲染可识别的排版并将遮挡物放置在预期文本区域之上。此设置对现有文本到图像生成器而言仍然具有挑战性:遮挡物常常偏离文本位置,文本可能被扭曲或显得悬浮在遮挡物之上。为此,我们提出了一种重启双流推理框架,通过解耦文本布局保持与遮挡物插入来应对此问题。Base流提供干净的排版参考和相同步骤的关键/值(K/V)特征,而Edit流则以遮挡提示为条件。我们进一步采用来自FreeText的谱字形先验想法,并将其适用于稳定早至中期去噪中的目标文本结构。在推理阶段,我们的方法定位目标文本,估计自标记条件注意力和字形支持所得的文本带区域,并推导出基于锚点的硬融合掩码用于遮挡物。在最终的编辑阶段,生成从相同初始噪声重新开始,并在所选注意力位置应用硬掩码引导的图像标记K/V替换,保持Base布局掩码之外的区域,同时从Edit流中注入掩码内部的遮挡物外观。实验在代表性遮挡文本场景中表明,本方法在文本可读性和遮挡物对齐方面显著改善,实现了更稳定的物体-on-text构图,无需任何模型微调。
引用
@article{arxiv.2605.16810,
title = {Training-Free Occluded Text Rendering via Glyph Priors and Attention-Guided Semantic Blending},
author = {Jingqi Hou and Hongtian Wang},
journal= {arXiv preprint arXiv:2605.16810},
year = {2026}
}
备注
9 pages, 3 figures, 3 tables