中文

WAON:大规模日本图像-文本对数据集用于提升日文文化任务模型性能

计算机视觉与模式识别 2026-04-02 v2 计算与语言

摘要

大规模图像-文本对数据集上的对比式预训练推动了视觉-语言表示学习的重大进展。最近的工作表明,针对特定领域进行语言或文化特定的微调是提高目标领域性能的有效方法。鉴于强大的开源多语言模型(如SigLIP2)的可用性,这一范式正变得越来越实用。然而,对于日文语言和文化内容而言,缺乏规模大且高质量的图像-文本对数据集仍是关键限制。为弥补这一差距,我们引入WAON,来自Common Crawl中日本网页内容构建的世界上最大日本图像-文本对数据集,包含约1.55亿个示例。我们的数据集构建管道采用过滤和去重以提高数据集质量。为提高对日文文化任务上日本图像分类评估的质量和可靠性,我们还构建了WAON-Bench,一个包含374个类别的手动挑选基准,用于日本文化图像分类,旨在解决现有基准中存在的类别不平衡和标签-图像不匹配问题。我们的实验表明,针对WAON进行微调比现有数据集更有效率地提高了日本文化基准上的模型性能,实现了与公开模型相当架构的州际最佳结果。我们发布了数据集、模型和代码。

关键词

引用

@article{arxiv.2510.22276,
  title  = {WAON: Large-Scale Japanese Image-Text Pair Dataset for Improving Model Performance on Japanese Cultural Tasks},
  author = {Issa Sugiura and Shuhei Kurita and Yusuke Oda and Daisuke Kawahara and Yasuo Okabe and Naoaki Okazaki},
  journal= {arXiv preprint arXiv:2510.22276},
  year   = {2026}
}

备注

14 pages, 7 figures