中文

预测社区对新闻文章特定兴趣的模型

信息检索 2018-08-29 v1 机器学习 机器学习

摘要

在这项工作中,我们提出两个问题:1. 仅使用新闻文章内容的特征,能否预测对其感兴趣的社区类型?2. 这些模型随时间泛化的能力如何?为回答这些问题,我们在来自reddit.com上4个社区的超过6万篇新闻文章上计算了经过充分研究的内容型特征。我们在2015至2017年间的三个不同时间段上训练并测试模型,以展示哪些特征因概念漂移而性能退化最严重。我们的模型能以高准确度将新闻文章分类到各社区,ROC AUC从0.81到1.0不等。然而,尽管我们能以高准确度预测新闻文章的社区特定热度,实践者应谨慎对待这些模型。预测既依赖于社区对,也依赖于特征组。此外,这些特征组随时间泛化能力不同,有些仅轻微退化,有些则大幅退化。因此,我们建议社区兴趣预测以层次化结构进行,可使用多个二分类器分离社区对,而非传统的多类模型。其次,这些模型应根据准确度目标和训练数据可用性随时间重新训练。

关键词

引用

@article{arxiv.1808.09270,
  title  = {Models for Predicting Community-Specific Interest in News Articles},
  author = {Benjamin D. Horne and William Dron and Sibel Adali},
  journal= {arXiv preprint arXiv:1808.09270},
  year   = {2018}
}

备注

Published at IEEE MILCOM 2018 in Los Angeles, CA, USA