中文

JaWildText:用于日本场景文本理解的视觉语言模型基准

计算机视觉与模式识别 2026-04-01 v2 人工智能

摘要

日本场景文本常被多语言基准所忽视,包括混合脚本、垂直书写以及远超拉丁字母的字符库。尽管日本语被包含在多个多语言基准中,但这些资源未能充分捕捉语言特性。此外,现有的日本视觉文本数据集主要聚焦于扫描文档,导致野外场景文本研究不足。为填补这一空白,我们引入 JaWildText,这是一个用于评估视觉语言模型(VLM)在日本场景文本理解方面的诊断基准。JaWildText 包含 3,241 个实例,来自 2,961 张日本新采集图像,标注 112 万字符,覆盖 3,643 个独特字符类型。它包含三个互补任务,差异化于视觉组织、输出格式和书写方向:(i)密集场景文本视觉问答(STVQA),需要对多段视觉文本证据进行推理;(ii)收据关键信息抽取(KIE),测试布局感知的结构化提取;(iii)手写体 OCR,评估跨媒介和不同书写方向的页面级转录。我们评估了 14 个开源 VLM,最佳模型在三个任务中平均得分为 0.64。错误分析显示识别仍是瓶颈,尤其是汉字。JaWildText 实现了对日本场景文本能力的细粒度、脚本感知诊断,并将随评估代码发布。

关键词

引用

@article{arxiv.2603.27942,
  title  = {JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text Understanding},
  author = {Koki Maeda and Naoaki Okazaki},
  journal= {arXiv preprint arXiv:2603.27942},
  year   = {2026}
}

备注

18 pages