中文

WikiWeb2M:一个页面级多模态维基百科数据集

计算与语言 2023-05-10 v1 计算机视觉与模式识别

摘要

网页一直是语言与视觉-语言任务的丰富资源。然而仅保留了网页的片段:图像- caption 对、长文本文章或原始 HTML,从未全部置于一处。网页任务因此很少受到关注,结构化的图像-文本数据也未得到充分利用。为研究多模态网页理解,我们引入了 Wikipedia Webpage 2M(WikiWeb2M)套件;这是首个保留页面中可用的全部图像、文本与结构数据的套件。WikiWeb2M 可用于页面描述生成、章节摘要与上下文图像 captioning 等任务。

关键词

引用

@article{arxiv.2305.05432,
  title  = {WikiWeb2M: A Page-Level Multimodal Wikipedia Dataset},
  author = {Andrea Burns and Krishna Srinivasan and Joshua Ainslie and Geoff Brown and Bryan A. Plummer and Kate Saenko and Jianmo Ni and Mandy Guo},
  journal= {arXiv preprint arXiv:2305.05432},
  year   = {2023}
}

备注

Accepted at the WikiWorkshop 2023. Data is readily available at https://github.com/google-research-datasets/wit/blob/main/wikiweb2m.md. arXiv admin note: text overlap with arXiv:2305.03668