基于指数模型的文本分段
cmp-lg
2008-02-03 v3 计算与语言
摘要
本文介绍了一种新的统计方法,用于自动将文本划分为连贯的片段。我们的方法利用短程和长程语言模型帮助识别文本中可能的主题变化位置。为了帮助其搜索,系统查阅一组简单词汇提示,这些提示通过检查大型已标注数据语料库而学习到与边界存在关联。我们还提出了一个新的概率驱动的错误度量标准,旨为自然语言处理和信息检索社区所用,取代精确率和召回率来评估分段算法。对我们算法的定性评估以及使用该新度量标准的评估显示,我们的方法在两个截然不同的领域——华尔街日报文章和 TDT 语料库(包含新闻稿和广播新闻稿 transcript)——中的有效性。
引用
@article{arxiv.cmp-lg/9706016,
title = {Text Segmentation Using Exponential Models},
author = {Doug Beeferman and Adam Berger and John Lafferty},
journal= {arXiv preprint arXiv:cmp-lg/9706016},
year = {2008}
}
备注
12 pages, LaTeX source and postscript figures for EMNLP-2 paper