中文

基于大语言模型的全球灾害亚国家地理编码

人工智能 2025-11-20 v1 应用统计

摘要

灾害事件的亚国家位置数据对风险评估和灾害风险减少至关重要。灾害数据库如EM-DAT常以非结构化文本形式报告位置,粒度或拼写不一致,难以与空间数据集集成。我们提出一种完全自动化的LLM辅助工作流程,使用GPT-4o处理和清理文本位置信息,并通过交叉检查三个独立的地理信息存储库:GADM、OpenStreetMap和Wikidata来分配几何位置。根据这些来源的一致性和可用性,我们为每个位置分配可靠性评分。应用于2000年至2024年的EM-DAT数据集,工作流程对14,215个事件进行地理编码,覆盖17,948个独特位置。与前述方法不同,本方法无需人工干预,覆盖所有灾害类型,支持跨源验证,并允许灵活地重映射到首选框架。除了数据集外,我们还展示了大语言模型从非结构化文本中提取和结构化地理信息的潜力,为相关分析提供可扩展且可靠的方法。

关键词

引用

@article{arxiv.2511.14788,
  title  = {Subnational Geocoding of Global Disasters Using Large Language Models},
  author = {Michele Ronco and Damien Delforge and Wiebke S. Jäger and Christina Corbane},
  journal= {arXiv preprint arXiv:2511.14788},
  year   = {2025}
}