中文

大型文本语料库的简洁比较摘要 (CCS) 及人类实验

计算与语言 2014-04-30 v1 应用统计

摘要

本文提出了一种针对大型文本语料库进行特定主题摘要的通用框架,并展示了其在新闻数据库分析中的应用。我们的框架称为简洁比较摘要(concise comparative summarization, CCS),建立在稀疏分类方法之上。CCS 是一种轻量级且灵活的工具,在当前广泛使用的基于简单词频的方法与更重量级、模型密集的方法(如潜在狄利克雷分配,LDA)之间提供了一种折衷方案。我们认为稀疏方法对文本分析大有裨益,并希望 CCS 能为这一重要领域开启新的研究分支。对于特定的感兴趣主题(例如中国或能源),CCS 会自动将文档标记为相关或不相关(通常通过关键词搜索),然后利用稀疏分类方法,根据文档中所有其他单词和短语的高维计数来预测这些标签。由此发现的一组少量预测性短语即被提取作为摘要。为了验证我们的工具,我们利用《纽约时报》国际版的新闻文章,设计并开展了一项人类调查,以比较不同摘要器与人类理解之间的差异。我们通过两个案例研究展示了我们的方法:一是对《纽约时报》在整个阿拉伯之春期间关于“埃及”的框架进行的媒体分析,二是对《纽约时报》和《华尔街日报》关于“能源”报道的非正式比较。总体而言,我们发现无论文档大小如何,带有 L2L^2 归一化的 Lasso 都能有效且实用地用于总结大型语料库。

关键词

引用

@article{arxiv.1404.7362,
  title  = {Concise comparative summaries (CCS) of large text corpora with a human experiment},
  author = {Jinzhu Jia and Luke Miratrix and Bin Yu and Brian Gawalt and Laurent El Ghaoui and Luke Barnesmoore and Sophie Clavier},
  journal= {arXiv preprint arXiv:1404.7362},
  year   = {2014}
}

备注

Published in at http://dx.doi.org/10.1214/13-AOAS698 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)