中文

STELLAR:低资源语言和真实数据的场景文本编辑器

计算机视觉与模式识别 2025-11-17 v2

摘要

场景文本编辑(STE)是指在保持视觉风格(如字体、颜色和背景)的同时修改图像中文本内容的任务。虽然最近的扩散方法在视觉质量方面取得了改进,但仍存在关键局限性:缺乏对低资源语言的支持、合成数据与真实数据的领域差距,以及缺乏评估文本风格保持的合适指标。为此,我们提出了STELLAR(Scene Text Editor for Low-resource LAnguages and Real-world data)。STELLAR通过语言自适应字体编码器和多阶段训练策略实现可靠的多语言编辑,首先在合成数据上进行预训练,然后在真实图像上进行微调。我们还构建了一个新数据集STIPLAR(Scene Text Image Pairs of Low-resource lAnguages and Real-world data),用于训练和评估。此外,我们提出了文本外观相似性(TAS),一种新型指标,通过独立测量字体、颜色和背景相似性来评估风格保持,使即使没有真实值也能进行稳健的评估。实验结果表明,STELLAR在视觉一致性和识别准确率方面优于最先进的模型,在各种语言上的TAS平均提升达2.2%。

关键词

引用

@article{arxiv.2511.09977,
  title  = {STELLAR: Scene Text Editor for Low-Resource Languages and Real-World Data},
  author = {Yongdeuk Seo and Hyun-seok Min and Sungchul Choi},
  journal= {arXiv preprint arXiv:2511.09977},
  year   = {2025}
}

备注

Accepted to AAAI 2026 Workshop (Artificial Intelligence with Biased or Scarce Data)