中文

土耳其媒体中新闻消费的无监督行为分析

社会与信息网络 2022-10-11 v2 机器学习

摘要

点击流数据伴随网站人类活动生成的海量体积,在新闻机构数字化后已成为识别读者特征的重要属性。尽管点击流数据在网站内部具有相似逻辑,但从广阔视角审视时,其在识别人类行为方面存在固有局限,这带来了将问题限定于细分领域的需要。本研究考察了组织网站上的匿名读者点击活动,以识别源自 Twitter 引荐、偶然到达但倾向主要被导向新闻内容的新闻消费模式。应用并比较了采用混合类型嵌入策略的集成聚类分析方法,以找出独立于时间的相似读者群体与兴趣。使用多种内部验证视角来确定聚类质量的最优性,其中发现 Calinski Harabasz 指数(CHI)给出了可泛化的结果。我们的发现表明,混合类型数据集的聚类接近最优内部验证分数,我们将其定义为在经 Uniform Manifold Approximation and Projection(UMAP)嵌入并采用一致性函数作为获取给定集成中最适用超参数配置之关键、而非直接使用一致性函数结果时,依所应用策略区分聚类与算法。对所得聚类的评估突出了在分离月度样本中重复出现的特定聚类,其 Adjusted Mutual Information 分数大于 0.5,这为新闻机构提供了洞察,并克服了因兴趣随时间变化导致的建模行为退化。

关键词

引用

@article{arxiv.2202.02056,
  title  = {Unsupervised Behaviour Analysis of News Consumption in Turkish Media},
  author = {Didem Makaroglu and Altan Cakir and Behcet Ugur Toreyin},
  journal= {arXiv preprint arXiv:2202.02056},
  year   = {2022}
}

备注

Submitted to Big Data Research