中文

灾害相关推文的识别:基于匹配还是基于学习?

信息检索 2017-05-08 v1 机器学习

摘要

诸如推文之类的社交媒体正成为灾害期间情境感知的贡献平台。受灾害影响人群(如请求援助、警告)与影响区外人群(如提供援助)在Twitter上共享的信息,将有助于急救人员、决策者和公众第一时间了解状况。有效利用此类信息需要及时选择并分析与特定灾害相关的推文。尽管海量推文作为数据源前景可观,但由于推文简短且非结构化,自动识别相关消息颇具挑战,导致常规基于学习的方法分类性能不尽如人意。因此,我们提出一种简单而有效的算法,基于匹配关键词与主题标签(hashtags)来识别相关消息,并提供了基于匹配与基于学习两种方法间的比较。为评估这两种方法,我们将它们置于一个专门提出的灾害相关推文分析框架中。在十一个不同灾害类型数据集上的分析结果表明,与学习方法相比,我们的技术提供了更高质量的相关推文以及更具可解释性的情感分析结果。

关键词

引用

@article{arxiv.1705.02009,
  title  = {On Identifying Disaster-Related Tweets: Matching-based or Learning-based?},
  author = {Hien To and Sumeet Agrawal and Seon Ho Kim and Cyrus Shahabi},
  journal= {arXiv preprint arXiv:1705.02009},
  year   = {2017}
}