中文

面向在线新闻文档中句子级信息流行度的主动预测

计算与语言 2023-01-03 v1 人工智能 机器学习

摘要

多项研究聚焦于预测在线文档整体的预期流行度,而未关注其各部分的贡献。我们引入一项任务:仅利用自然语言内容主动预测在线新闻文档中句子的流行度。我们将句子级流行度预测建模为序列回归任务。为训练模型,我们整理了InfoPop,这是首个包含来自逾50,000篇在线新闻文档中超过170万句子的流行度标签的数据集。据我们所知,这是首个利用传入搜索引擎查询流自动生成句子级流行度标注的数据集。我们提出一种以句子显著性预测为辅助任务的新颖迁移学习方法。我们提出的技术结合基于BERT的神经模型,在主动句子级流行度预测上超过0.8的nDCG值。值得注意的是,我们的研究给出一个非平凡的启示:尽管流行度与显著性为不同概念,从显著性预测进行迁移学习可增强流行度预测。我们发布InfoPop并公开代码:https://github.com/sayarghoshroy/InfoPopularity

关键词

引用

@article{arxiv.2301.00152,
  title  = {Towards Proactively Forecasting Sentence-Specific Information Popularity within Online News Documents},
  author = {Sayar Ghosh Roy and Anshul Padhi and Risubh Jain and Manish Gupta and Vasudeva Varma},
  journal= {arXiv preprint arXiv:2301.00152},
  year   = {2023}
}

备注

In 33rd ACM Conference on Hypertext and Social Media [HT '22] (Main Track), Link: https://dl.acm.org/doi/10.1145/3511095.3531268