基于定制化数据上Transformer模型预测推文地理位置
计算与语言
2025-01-13 v6 人工智能
信息检索
机器学习
摘要
本研究旨在解决推文/用户地理位置预测任务,并为文本大数据的地理标注提供灵活的方法论。所提出的方法实现了用于自然语言处理(NLP)的神经网络,以将位置估计为坐标对(经度,纬度)和二维高斯混合模型(GMMs)。所提模型的范围已在Twitter数据集上使用预训练的来自Transformers的双向编码器表示(BERT)作为基础模型进行了微调。性能指标显示,在 worldwide 级别上中位数误差小于30 km,在 US 级别数据集上对于基于推文内容和元数据上下文的文本特征训练并评估的模型中位数误差小于15 km。我们的源代码和数据可在 https://github.com/K4TEL/geo-twitter.git 获取。
引用
@article{arxiv.2303.07865,
title = {Predicting the Geolocation of Tweets Using transformer models on Customized Data},
author = {Kateryna Lutsai and Christoph H. Lampert},
journal= {arXiv preprint arXiv:2303.07865},
year = {2025}
}
备注
31 pages, 5 tables, 9 figures