从海量突发新闻中在线构建故事森林
信息检索
2018-03-02 v1 计算与语言
摘要
我们描述了在腾讯实现的一个新闻内容组织系统的经验,该系统从海量突发新闻流中发现事件,并以在线方式演化新闻故事结构。与先前关于话题检测与跟踪(TDT)以及事件时间线或图生成的研究相比,我们的真实系统有着不同的需求:1)需要从覆盖多样主题且包含高度冗余信息的大规模长文本文档流中准确、快速地抽取可区分的事件;2)必须以在线方式逐步构建事件故事的结构,而不对先前已形成的故事反复重构,以保证一致的用户浏览体验。为解决这些挑战,我们提出 Story Forest,一组在线方案,自动将流式文档聚类为事件,同时将相关事件连接于不断生长的树中,以讲述演化的故事。我们基于 60 GB 的真实中文新闻数据进行了广泛评估,尽管我们的思想不依赖于语言,并可通过细致的用户体验试点研究轻松扩展到其他语言。结果表明,与多种现有算法框架相比,Story Forest 在准确识别事件并将新闻文本组织为吸引人类读者的逻辑结构方面具有优越能力。
引用
@article{arxiv.1803.00189,
title = {Growing Story Forest Online from Massive Breaking News},
author = {Bang Liu and Di Niu and Kunfeng Lai and Linglong Kong and Yu Xu},
journal= {arXiv preprint arXiv:1803.00189},
year = {2018}
}
备注
Accepted by CIKM 2017, 9 pages