中文

基于自导引扩散Transformer的开放词汇场景文本编辑

计算机视觉与模式识别 2026-05-28 v2

摘要

场景文本编辑旨在修改图像中目标区域的文本,同时保持周围背景的风格和纹理。现有方法仅依赖图像背景信息,忽略目标区域的视觉细节,这会丢弃原始文本中的风格特征,本质上使任务退化为文本渲染。此外,预训练的字形编码器限制了可编辑文本的范围。为此,本文提出了一种自导引场景文本编辑方法,从原始图像中直接构建风格和字形提示,而无需引入额外的风格或字形编码器。我们采用两阶段训练策略:首先在大规模自监督数据上训练扩散Transformer,然后使用小量配对图像进行精炼。通过利用多模态扩散Transformer(MM-DiT)的上下文学习能力,实现了开放词汇且风格一致的文本编辑。在 various语言上进行的实验结果表明,我们的方法在文本准确率和风格一致性方面实现了最先进的性能。我们的项目页面:hongxiii.github.io/mstedit。

关键词

引用

@article{arxiv.2605.15523,
  title  = {Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning},
  author = {Hongxi Li and Tong Wang and Chengjing Wu and Tianbao Liu and Jiangtao Yao and Xiaochao Qu and Xinxiao Wu and Luoqi Liu and Ting Liu},
  journal= {arXiv preprint arXiv:2605.15523},
  year   = {2026}
}

备注

ICML 2026