中文

衡量 Common Crawl 语料库中的地理空间信息

计算与语言 2026-05-07 v2 人工智能

摘要

大型语言模型(LLM)显示出新兴的地理空间能力,这源于它们在来自 Common Crawl(CC)语料库的大规模未标注文本数据上进行预训练。然而,CC 中包含的地理空间内容仍基本未被探索,这影响了我们对 LLM 空间推理能力的理解。本文使用强大的语言模型 Gemini 1.5 探讨了 CC 最近版本中地理空间数据的流行程度。通过分析文档样本并手动修订结果,我们估计了 CC 中 18.7% 的网页文档包含坐标、地址等地理空间信息。我们发现英文文档和非英文文档的流行程度几乎没有差别。我们的发现为 CC 中地理空间数据的性质与范围提供了定量见解,为未来研究 LLM 的地理空间偏差奠定了基础。

关键词

引用

@article{arxiv.2406.04952,
  title  = {Quantifying Geospatial in the Common Crawl Corpus},
  author = {Ilya Ilyankou and Meihui Wang and Stefano Cavazzi and James Haworth},
  journal= {arXiv preprint arXiv:2406.04952},
  year   = {2026}
}

备注

Accepted as a poster to ACM SIGSPATIAL 2024