单遍自适应自然语言过滤:大规模社交媒体新闻论坛中用户生成评论的价值度量
计算与语言
2017-01-13 v1
摘要
在 Reddit.com、Tumblr.com、Facebook.com 和 Hacker News 等热门新闻论坛上挖掘众包评论具有大量洞察与社会发现潜力。遗憾的是,由于参与量巨大且评论质量参差不齐,从此类数据中提取价值并非总是显而易见或及时的。通过设计高效的单遍(single-pass)自适应自然语言过滤器,快速剪除垃圾信息、噪声、抄袭帖、营销偏离内容以及脱离上下文的帖子,我们可以移除超过三分之一的条目,并返回与所讨论原始文章具有更高相关概率的评论。本文提出的方法采用自适应的两步过滤过程。它首先利用线程中发布的原始文章作为起始语料库,通过匹配交集词和每句的术语比例平衡来解析评论,随后通过从高匹配评论中采集新词来扩充语料库,从而随时间提高过滤准确性。
引用
@article{arxiv.1701.03231,
title = {Single-Pass, Adaptive Natural Language Filtering: Measuring Value in User Generated Comments on Large-Scale, Social Media News Forums},
author = {Manuel Amunategui},
journal= {arXiv preprint arXiv:1701.03231},
year = {2017}
}
备注
52 pages and python code included in index