中文

识别标题党:一种使用神经网络的多策略方法

信息检索 2018-08-02 v4 计算与语言 计算机与社会 社会与信息网络

摘要

在线媒体为了扩大其覆盖范围并随后通过广告变现增加收入,已开始采用标题党技术来引诱读者点击文章。然而文章却未能兑现标题所作的承诺。传统的标题党检测方法严重依赖特征工程,而这反过来又依赖于为其构建的数据集。神经网络在该任务中的应用仅得到了部分探索。我们提出了一种考虑社交媒体帖子中所有信息的新颖方法。我们训练了一个带有注意力机制的双向 LSTM,以差异化方式学习单词对帖子标题党分数的贡献程度。我们还采用了 Siamese 网络来捕捉源信息与目标信息之间的相似度。以往的方法未考虑从图像中提取的信息。我们使用卷积神经网络从大量数据中学习图像嵌入,为我们的模型增加另一层复杂度。最后,我们拼接来自三个独立组件的输出,将其作为全连接层的输入。我们在包含 19538 条社交媒体帖子的测试语料库上进行了实验,在该数据集上获得了 65.37% 的 F1 分数,超越了先前的 SOTA 以及其他提出的无论是否基于特征工程的方法。

关键词

引用

@article{arxiv.1710.01507,
  title  = {Identifying Clickbait: A Multi-Strategy Approach Using Neural Networks},
  author = {Vaibhav Kumar and Dhruv Khattar and Siddhartha Gairola and Yash Kumar Lal and Vasudeva Varma},
  journal= {arXiv preprint arXiv:1710.01507},
  year   = {2018}
}

备注

Accepted at SIGIR 2018 as Short Paper