预测社区对新闻文章特定兴趣的模型
信息检索
2018-08-29 v1 机器学习
机器学习
摘要
在这项工作中,我们提出两个问题:1. 仅使用新闻文章内容的特征,能否预测对其感兴趣的社区类型?2. 这些模型随时间泛化的能力如何?为回答这些问题,我们在来自reddit.com上4个社区的超过6万篇新闻文章上计算了经过充分研究的内容型特征。我们在2015至2017年间的三个不同时间段上训练并测试模型,以展示哪些特征因概念漂移而性能退化最严重。我们的模型能以高准确度将新闻文章分类到各社区,ROC AUC从0.81到1.0不等。然而,尽管我们能以高准确度预测新闻文章的社区特定热度,实践者应谨慎对待这些模型。预测既依赖于社区对,也依赖于特征组。此外,这些特征组随时间泛化能力不同,有些仅轻微退化,有些则大幅退化。因此,我们建议社区兴趣预测以层次化结构进行,可使用多个二分类器分离社区对,而非传统的多类模型。其次,这些模型应根据准确度目标和训练数据可用性随时间重新训练。
引用
@article{arxiv.1808.09270,
title = {Models for Predicting Community-Specific Interest in News Articles},
author = {Benjamin D. Horne and William Dron and Sibel Adali},
journal= {arXiv preprint arXiv:1808.09270},
year = {2018}
}
备注
Published at IEEE MILCOM 2018 in Los Angeles, CA, USA