衡量 Common Crawl 语料库中的地理空间信息
计算与语言
2026-05-07 v2 人工智能
摘要
大型语言模型(LLM)显示出新兴的地理空间能力,这源于它们在来自 Common Crawl(CC)语料库的大规模未标注文本数据上进行预训练。然而,CC 中包含的地理空间内容仍基本未被探索,这影响了我们对 LLM 空间推理能力的理解。本文使用强大的语言模型 Gemini 1.5 探讨了 CC 最近版本中地理空间数据的流行程度。通过分析文档样本并手动修订结果,我们估计了 CC 中 18.7% 的网页文档包含坐标、地址等地理空间信息。我们发现英文文档和非英文文档的流行程度几乎没有差别。我们的发现为 CC 中地理空间数据的性质与范围提供了定量见解,为未来研究 LLM 的地理空间偏差奠定了基础。
引用
@article{arxiv.2406.04952,
title = {Quantifying Geospatial in the Common Crawl Corpus},
author = {Ilya Ilyankou and Meihui Wang and Stefano Cavazzi and James Haworth},
journal= {arXiv preprint arXiv:2406.04952},
year = {2026}
}
备注
Accepted as a poster to ACM SIGSPATIAL 2024