基于自导引扩散Transformer的开放词汇场景文本编辑
计算机视觉与模式识别
2026-05-28 v2
摘要
场景文本编辑旨在修改图像中目标区域的文本,同时保持周围背景的风格和纹理。现有方法仅依赖图像背景信息,忽略目标区域的视觉细节,这会丢弃原始文本中的风格特征,本质上使任务退化为文本渲染。此外,预训练的字形编码器限制了可编辑文本的范围。为此,本文提出了一种自导引场景文本编辑方法,从原始图像中直接构建风格和字形提示,而无需引入额外的风格或字形编码器。我们采用两阶段训练策略:首先在大规模自监督数据上训练扩散Transformer,然后使用小量配对图像进行精炼。通过利用多模态扩散Transformer(MM-DiT)的上下文学习能力,实现了开放词汇且风格一致的文本编辑。在 various语言上进行的实验结果表明,我们的方法在文本准确率和风格一致性方面实现了最先进的性能。我们的项目页面:hongxiii.github.io/mstedit。
引用
@article{arxiv.2605.15523,
title = {Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning},
author = {Hongxi Li and Tong Wang and Chengjing Wu and Tianbao Liu and Jiangtao Yao and Xiaochao Qu and Xinxiao Wu and Luoqi Liu and Ting Liu},
journal= {arXiv preprint arXiv:2605.15523},
year = {2026}
}
备注
ICML 2026