中文

RATE:克服实时位置估计中文本特征的噪声与稀疏性

计算与语言 2023-10-24 v1 机器学习

摘要

社交媒体用户的实时位置推断是本地化搜索和事件检测等空间应用的基础。虽然推文文本是位置估计中最常用的特征,但大多数先前工作要么受困于文本特征的噪声,要么受困于其稀疏性。本文旨在解决这两个问题。我们使用主题建模作为基本模块来刻画地理主题变异与词汇变异,从而不再直接使用“one-hot”编码向量。我们还融合了可通过 Twitter 流式 API 提取的其他特征,以克服噪声问题。实验结果表明,我们的 RATE 算法在区域分类的准确率和经纬度回归的平均距离误差上均优于若干基准方法。

关键词

引用

@article{arxiv.2111.06515,
  title  = {RATE: Overcoming Noise and Sparsity of Textual Features in Real-Time Location Estimation},
  author = {Yu Zhang and Wei Wei and Binxuan Huang and Kathleen M. Carley and Yan Zhang},
  journal= {arXiv preprint arXiv:2111.06515},
  year   = {2023}
}

备注

4 pages; Accepted to CIKM 2017; Some typos fixed