中文

面向鲁棒复杂动漫场景文本检测的大规模数据集

计算机视觉与模式识别 2025-10-10 v1 人工智能

摘要

当前文本检测数据集主要针对自然场景或文档场景,文本通常呈现规律的字体和形状、单调的颜色以及有序的布局。文本通常沿直线或曲线排列。然而,这些特征与动漫场景有显著差异,后者中文本式多样、布局不规则,且容易与符号或装饰图案等复杂视觉元素混淆。动漫场景中的文本包含大量手写和特殊字体。为弥合这一差距,我们引入 AnimeText,一个包含 73.5 万张图片和 420 万个标注文本块的大规模数据集。它特别为动漫场景设计了分层标注和硬负样本。跨数据集评估使用最新方法表明,训练 AnimeText 的模型在动漫文本检测任务中优于现有数据集。为评估 AnimeText 在复杂动漫场景中的鲁棒性,我们进行了跨数据集基准测试,使用最新文本检测方法。实验结果表明,训练 AnimeText 的模型在动漫场景文本检测任务中优于训练现有数据集的模型。AnimeText 数据集已在 HuggingFace 上发布: https://huggingface.co/datasets/deepghs/AnimeText

关键词

引用

@article{arxiv.2510.07951,
  title  = {A Large-scale Dataset for Robust Complex Anime Scene Text Detection},
  author = {Ziyi Dong and Yurui Zhang and Changmao Li and Naomi Rue Golding and Qing Long},
  journal= {arXiv preprint arXiv:2510.07951},
  year   = {2025}
}