中文

结合词汇与句法特征检测新闻中的内容密集文本

计算与语言 2017-04-04 v1

摘要

内容密集新闻以直接、简洁的方式报道关于事件的重要事实信息。信息抽取、问答和摘要等信息寻求应用通常假定其处理的所有文本都是内容密集的。本文在商业、美国国际关系、体育和科学新闻领域的新闻文章上对该假设进行实证检验。我们的发现清楚地表明,研究中约一半的新闻文本实际上并非内容密集,这促使我们开发有监督的内容密度检测器。我们启发式地标记大规模训练语料用于该任务,并基于词汇与无词汇化句法特征训练了一个两层分类模型。在人工标注数据上,我们比较了仅使用给定新闻领域数据训练的域特定分类器,以及汇集所有四个领域数据的通用分类器的性能。我们的标注与预测实验表明,内容密度的概念随领域而异,且朴素标注者的判断偏向于刻板领域标签。对于内容密集文本通常较少的领域,域特定分类器更准确。域独立分类器能更好地复现朴素的众包判断。在所有条件下分类预测准确率均较高,约为80%。

关键词

引用

@article{arxiv.1704.00440,
  title  = {Combining Lexical and Syntactic Features for Detecting Content-dense Texts in News},
  author = {Yinfei Yang and Ani Nenkova},
  journal= {arXiv preprint arXiv:1704.00440},
  year   = {2017}
}

备注

In submission to JAIR