中文

全局-局部感知场景文本编辑

计算机视觉与模式识别 2025-12-04 v1

摘要

场景文本编辑(STE)涉及在场景图像中替换文本为目标新文本,同时保留原始文本样式和背景纹理。现有方法存在两个主要挑战:不一致性和长度不敏感性。它们往往无法维持编辑局部块与周围区域的一致性,并且在处理编辑前后文本长度的显著差异时存在困难。为应对这些挑战,我们提出了一个端到端框架——全局-局部感知场景文本编辑(GLASTE),它同时融入高层全局上下文信息与精细局部特征。具体而言,我们设计了一种全局-局部组合结构、联合全局与局部损失函数,并增强文本图像特征以确保局部块内文本样式的一致性,同时保持局部与全局区域之间的和谐。此外,我们将文本样式表示为独立于图像尺寸的向量,可将其迁移至各种尺寸的目标文本图像。我们使用仿射融合将目标文本图像填充到编辑块中,同时保持其宽高比不变。在真实世界数据集上的大量实验验证了我们的 GLASTE 模型在定量指标和定性结果上均优于先前方法,并有效缓解了上述两个挑战。

关键词

引用

@article{arxiv.2512.03574,
  title  = {Global-Local Aware Scene Text Editing},
  author = {Fuxiang Yang and Tonghua Su and Donglin Di and Yin Chen and Xiangqian Wu and Zhongjie Wang and Lei Fan},
  journal= {arXiv preprint arXiv:2512.03574},
  year   = {2025}
}