CC-GPX:从Common Crawl中提取高质量标注地理空间数据的方法
计算与语言
2026-05-07 v3
摘要
Common Crawl(CC)语料库是目前最大的开放式网页抓取数据集,自2008年起累计包含9.5+ PetaBytes的数据。该数据集在大规模语言模型训练中起着关键作用,因此已被研究用于(不)理想的内容,并被提炼出针对特定小型领域的数据集。然而,迄今为止尚无研究致力于将CC用作标注地理空间数据源。在本文中,我们介绍了从CC中高效提取GPX文件中标注用户轨迹的管道,并构建了包含1,416组人工撰写描述与来自最近6次CC版本中MultiLineString矢量数据的多模态数据集。该数据集可用于研究人们的户外活动模式、人们如何描述户外经历,亦可用于开发轨迹生成或轨迹标注模型,或用于替代人工生成路径的其他问题。我们的可复现代码已发布在GitHub上:https://github.com/ilyankou/cc-gpx
引用
@article{arxiv.2405.11039,
title = {CC-GPX: Extracting High-Quality Annotated Geospatial Data from Common Crawl},
author = {Ilya Ilyankou and Meihui Wang and Stefano Cavazzi and James Haworth},
journal= {arXiv preprint arXiv:2405.11039},
year = {2026}
}
备注
Accepted as a poster to ACM SIGSPATIAL 2024