基于大规模评论语料库的细粒度剧透检测
计算与语言
2019-06-03 v1
摘要
本文提出用于自动检测媒体产品评论中关键情节转折的计算方法。首先,我们构建了一个大规模书籍评论数据集,包含句子级的细粒度剧透标注,以及书籍与(匿名)用户信息。其次,我们细致分析了该数据集,发现:剧透语言往往具有书籍特异性;剧透分布在不同书籍与评论作者间差异显著;剧透句子倾向于在评论后段集中出现。第三,受这些发现启发,我们开发了端到端神经网络架构以检测评论语料中的剧透句子。定量与定性结果均表明所提方法大幅优于现有基线。
引用
@article{arxiv.1905.13416,
title = {Fine-Grained Spoiler Detection from Large-Scale Review Corpora},
author = {Mengting Wan and Rishabh Misra and Ndapa Nakashole and Julian McAuley},
journal= {arXiv preprint arXiv:1905.13416},
year = {2019}
}
备注
6 pages; ACL'19