突发灾害期间信息推文的半监督发现
计算与语言
2016-10-13 v1 社会与信息网络
摘要
在突发灾害期间,为了利用 Twitter 等微博客服务进行态势感知,首要目标是发现与灾害相关的帖子。鉴于灾害类型的多样性,使用预先选定的灾害相关关键词进行发现是次优的。我们在本工作中关注的替代方案是,利用灾害发生时逐渐获得的一小部分带标注帖子来训练分类器。我们的假设是,与仅在标注数据上训练分类器相比,利用大量历史微博可以提高分类质量。我们提出使用未标注微博将词汇聚类为有限数量的簇,并将词簇作为分类特征。为了评估所提出的半监督方法,我们使用了来自 6 次不同灾害的 Twitter 数据。结果表明,当标注推文数量为 100 条或更少时,所提出的方法优于基于词袋特征表示的标准分类。结果还表明,未标注语料库的选择、词聚类算法的选择以及超参数的选择都会对分类精度产生显著影响。
引用
@article{arxiv.1610.03750,
title = {Semi-supervised Discovery of Informative Tweets During the Emerging Disasters},
author = {Shanshan Zhang and Slobodan Vucetic},
journal= {arXiv preprint arXiv:1610.03750},
year = {2016}
}