Twitter用户地理定位有效评估的实用指南
社会与信息网络
2019-07-31 v1
摘要
Twitter用户地理定位——即识别其家乡位置的任务——服务于广泛的社区与商业应用,如自然灾害管理、新闻业和公共卫生。已有许多基于用户推文自动地理定位的方法被提出;同时,各种用于衡量这些方法有效性的评估指标也被提出,这使得理解哪些指标最适合该任务变得具有挑战性。在本文中,我们通过在受控实验设置下分析十五个模型和两个基线,提出了一种Twitter用户地理定位标准化评估指南。模型在四种地理粒度上使用十种指标进行评估。我们使用秩相关来评估这些指标的有效性。我们的结果表明,有效性指标的选择可能对从地理定位系统实验得出的结论产生重大影响,潜在地导致实验者就相对有效性得出相互矛盾的结果。我们表明,对于一般评估,应报告一系列性能指标,以确保传达系统有效性的完整图景。鉴于该任务的全球地理覆盖,我们特别建议在微观与宏观层面进行评估,以衡量位置分布偏差的影响。尽管近年来应用了许多复杂的地理定位算法,多数类基线在粗地理粒度上仍具竞争力。我们提出了一套基于所采用指标的统计分析检验,以确保结果并非偶然。
引用
@article{arxiv.1907.12700,
title = {A Practical Guide for the Effective Evaluation of Twitter User Geolocation},
author = {Ahmed Mourad and Falk Scholer and Walid Magdy and Mark Sanderson},
journal= {arXiv preprint arXiv:1907.12700},
year = {2019}
}
备注
Accepted in the journal of ACM Transactions on Social Computing (TSC). Extended version of the ASONAM 2018 short paper. Please cite the TSC/ASONAM version and not the arxiv version