ClueWeb22:带有视觉与语义信息的百亿级网页文档集
信息检索
2022-12-05 v2 人工智能
计算与语言
摘要
ClueWeb22 是 ClueWeb 系列数据集的最新迭代,提供带有丰富信息的 100 亿网页。其设计受到对支持学术与产业研究(例如信息系统、检索增强 AI 系统与模型预训练)所需高质量大规模网页语料的需求影响。相较早期 ClueWeb 语料,ClueWeb22 语料规模更大、更多样、质量更高,并与商业网页搜索中的文档分布一致。除原始 HTML 外,ClueWeb22 包含由工业标准文档理解系统提供的关于网页的丰富信息,包括由网页浏览器渲染的页面视觉表示、来自神经网络解析器的解析 HTML 结构信息,以及为降低使用门槛而预处理过的清洗文档文本。这些信号中许多已在产业界广泛使用,但首次以该规模向研究界开放。
引用
@article{arxiv.2211.15848,
title = {ClueWeb22: 10 Billion Web Documents with Visual and Semantic Information},
author = {Arnold Overwijk and Chenyan Xiong and Xiao Liu and Cameron VandenBerg and Jamie Callan},
journal= {arXiv preprint arXiv:2211.15848},
year = {2022}
}