DEJIMA:面向图像字幕与视觉问答的大规模日语数据集
计算机视觉与模式识别
2025-12-02 v1
摘要
本工作针对日语视觉-语言(V&L)建模领域缺乏高质量大规模资源的现状,提出了一种可扩展且可复现的管道,集成大规模网页采集、严格的过滤与去重、基于目标检测的证据提取,以及受制约 grounding 条件下的大语言模型(LLM)优化。通过该管道,我们构建了两个资源:图像-字幕数据集(DEJIMA-Cap)和视觉问答数据集(DEJIMA-VQA),每个数据集包含 388 万张图像-文本对,远超现有日语 V&L 数据集的规模。人类评估表明,DEJIMA 在日语化程度和语言自然性方面显著优于通过翻译或人工标注构建的数据集,同时在事实正确性方面保持与人工标注语料相当的水平。进一步的图像特征分布量化分析确认,DEJIMA 广泛覆盖了以日本为特征的多样化视觉领域,补充了其在语言和文化代表性方面的优势。在多个日语多模态基准测试上训练的模型表现出一致的性能提升,证明了文化依赖性大规模资源在提升模型性能方面发挥着关键作用。我们的所有数据来源和管道模块均允许商业使用,并公开发布所构建的数据集及其元数据,以鼓励日语 V&L 建模的进一步研究和工业应用。
引用
@article{arxiv.2512.00773,
title = {DEJIMA: A Novel Large-scale Japanese Dataset for Image Captioning and Visual Question Answering},
author = {Toshiki Katsube and Taiga Fukuhara and Kenichiro Ando and Yusuke Mukuta and Kohei Uehara and Tatsuya Harada},
journal= {arXiv preprint arXiv:2512.00773},
year = {2025}
}