中文

DanQing:一个面向中文视觉语言预训练的大规模数据集

计算机视觉与模式识别 2026-03-26 v3 人工智能

摘要

视觉语言预训练(VLP)模型通过利用大规模图像-文本对来实现显著的成功。虽然以英文为中心的模型如CLIP和SigLIP受益于大规模数据集(如LAION-400M),但中文VLP的开发仍受制于缺乏高质量的大规模开放源数据集。本文提出DanQing,一个包含1亿个高质量图像-文本对的中文跨模态数据集,数据从Common Crawl中筛选而来。为确保数据质量,我们开发了一套有效的系统性管道,包括数据源选择、文本精炼、视觉多样化和跨模态跨批次过滤,从而有效缓解了网络数据中固有的噪声。值得注意的是,DanQing包含2024-2025年的数据,使模型能够捕捉当代语义趋势和新兴概念。通过对SigLIP2模型进行持续预训练的大量实验表明,DanQing在各种下游任务上(包括零样本分类、跨模态检索和中文中心大型多模态模型任务)均优于现有的中文数据集。此外,对DanQing的深入分析显示,它在语义分布更均衡、扩张能力更优方面优于现有数据集。为进一步推动中文视觉语言预训练研究,本文将在Creative Common CC-BY-NC 4.0许可证下开源DanQing数据集。

关键词

引用

@article{arxiv.2601.10305,
  title  = {DanQing: An Up-to-Date Large-Scale Chinese Vision-Language Pre-training Dataset},
  author = {Hengyu Shen and Tiancheng Gu and Bin Qin and Lan Wu and Yuling Wu and Shuo Tan and Zelong Sun and Jun Wang and Nan Wu and Xiang An and Weidong Cai and Ziyong Feng and Kaicheng Yang},
  journal= {arXiv preprint arXiv:2601.10305},
  year   = {2026}
}

备注

19 pages, 11 figures, 7 tables