中文

识别协同场景文本编辑

计算机视觉与模式识别 2026-03-11 v3

摘要

场景文本编辑旨在修改场景图像中的文本内容,同时保持风格一致性。传统方法通过显式解耦源图像中的风格与内容,然后将风格与目标内容融合,同时利用预训练识别模型确保内容一致性来实现。尽管取得了显著进展,但这些方法存在复杂的流水线,导致在复杂场景下性能不佳。在本工作中,我们提出了识别协同场景文本编辑(RS-STE),一种充分利用文本识别用于编辑的内在协同性的新方法。我们的模型将文本识别与文本编辑无缝集成在一个统一框架中,并利用识别模型在确保内容一致性的同时隐式解耦风格与内容的能力。具体而言,我们的方法采用基于Transformer架构的多模态并行解码器,并行预测文本内容和风格化图像。此外,我们的循环自监督微调策略能够在无真实标签的非配对真实数据上进行有效训练,通过两次循环生成过程增强风格与内容一致性。基于相对简单的架构,RS-STE在合成和真实世界基准上均达到了最先进的性能,并进一步证明了利用生成的困难案例来提升下游识别任务性能的有效性。代码可在 https://github.com/ZhengyaoFang/RS-STE 获取。

关键词

引用

@article{arxiv.2503.08387,
  title  = {Recognition-Synergistic Scene Text Editing},
  author = {Zhengyao Fang and Pengyuan Lyu and Jingjing Wu and Chengquan Zhang and Jun Yu and Guangming Lu and Wenjie Pei},
  journal= {arXiv preprint arXiv:2503.08387},
  year   = {2026}
}

备注

accepted by CVPR2025