中文

StyleText:场景文本样式化 inpainting 的大规模数据集与基准

计算机视觉与模式识别 2026-05-19 v1 人工智能

摘要

我们提出StyleText,一个用于局部场景文本 inpainting 且保留样式的大规模数据集和基准。StyleText包含28,518组图像-掩码-提示三元组,分为9,932个场景族,支持在共享场景上下文下对文本可读性和视觉一致性进行受控评估。我们构建数据集的自动化管道组合了LLM提示模板化、基于关键-值(KV)缓存注入的Flux源生成、OCR-based语义过滤、多边形掩码提取和掩码条件FluxFill增强。我们定义使用归一化OCR指标(词准确率和字符错误率)和CLIP图像-图像相似度(带显式预处理)的可复现评估协议。在StyleText上训练的FluxFill+LoRA基线显著提高了OCR准确率,同时保持场景样式一致性,为未来比较树立了强有力的参考基准。

关键词

引用

@article{arxiv.2605.17309,
  title  = {StyleText: A Large-Scale Dataset and Benchmark for Stylized Scene Text Inpainting},
  author = {Aleksandr Simonyan and Nipun Jindal},
  journal= {arXiv preprint arXiv:2605.17309},
  year   = {2026}
}

备注

Accepted at the SynData4CV Workshop, CVPR 2026. 8 pages + 1 page of references, 5 figures, 4 tables