微文本的非参数贝叶斯故事线检测
计算与语言
2016-09-27 v2 机器学习
摘要
新闻事件和社交媒体由不断演化的故事线组成,这些故事线在有限时间内吸引公众注意力。识别故事线需要整合时间和语言信息,而先前工作主要采取启发式方法。我们提出了一种新颖的在线非参数贝叶斯框架用于故事线检测,使用距离依赖的中国餐馆过程(dd-CRP)。为确保高效的线性时间推断,我们采用了固定滞后吉布斯采样过程,这对于dd-CRP而言是新颖的。我们在TREC Twitter时间线生成(TTG)任务上进行了评估,获得了令人鼓舞的结果:尽管使用了较弱的基线检索模型,dd-CRP故事聚类方法仍与2014年TTG任务中的最佳参赛条目具有竞争力。
引用
@article{arxiv.1601.04580,
title = {Nonparametric Bayesian Storyline Detection from Microtexts},
author = {Vinodh Krishnan and Jacob Eisenstein},
journal= {arXiv preprint arXiv:1601.04580},
year = {2016}
}
备注
Appeared at the Workshop on Computing News Storylines at the 2016 Conference on Empirical Methods in Natural Language Processing (EMNLP 2016)