WikiWeb2M:一个页面级多模态维基百科数据集
计算与语言
2023-05-10 v1 计算机视觉与模式识别
摘要
网页一直是语言与视觉-语言任务的丰富资源。然而仅保留了网页的片段:图像- caption 对、长文本文章或原始 HTML,从未全部置于一处。网页任务因此很少受到关注,结构化的图像-文本数据也未得到充分利用。为研究多模态网页理解,我们引入了 Wikipedia Webpage 2M(WikiWeb2M)套件;这是首个保留页面中可用的全部图像、文本与结构数据的套件。WikiWeb2M 可用于页面描述生成、章节摘要与上下文图像 captioning 等任务。
引用
@article{arxiv.2305.05432,
title = {WikiWeb2M: A Page-Level Multimodal Wikipedia Dataset},
author = {Andrea Burns and Krishna Srinivasan and Joshua Ainslie and Geoff Brown and Bryan A. Plummer and Kate Saenko and Jianmo Ni and Mandy Guo},
journal= {arXiv preprint arXiv:2305.05432},
year = {2023}
}
备注
Accepted at the WikiWorkshop 2023. Data is readily available at https://github.com/google-research-datasets/wit/blob/main/wikiweb2m.md. arXiv admin note: text overlap with arXiv:2305.03668