面向无训练场景的文本场景编辑
计算机视觉与模式识别
2026-03-26 v1
摘要
场景文本编辑旨在自然图像中修改文本内容,同时保持视觉真实性和语义一致性。现有方法通常需要特定任务的训练或配对数据,限制了其可扩展性和适应性。在本文中,我们提出 TextFlow,一个无训练的场景文本编辑框架,整合了 Attention Boost(AttnBoost)和 Flow Manifold Steering(FMS)的优势,实现对文本的灵活、高保真编辑,无需额外训练。具体而言,FMS 通过建模字符和背景区域的视觉流,保留结构和风格一致性;AttnBoost 通过注意力机制引导,增强文本内容的渲染效果。通过联合利用这些互补模块,我们的方法在语义对齐和空间细化中实现端到端的文本编辑,采用即插即用的方式。广泛的实验表明,我们的框架在视觉质量和文本准确性方面,与或优于基于训练的方法,能够在多样化场景和语言之间获得良好的泛化。该研究推动了场景文本编辑向更高效、更通用和无训练范式的发展。代码已公开于 https://github.com/lyb18758/TextFlow。
引用
@article{arxiv.2603.24571,
title = {Towards Training-Free Scene Text Editing},
author = {Yubo Li and Xugong Qin and Peng Zhang and Hailun Lin and Gangyan Zeng and Kexin Zhang},
journal= {arXiv preprint arXiv:2603.24571},
year = {2026}
}
备注
Accepted by CVPR 2026