中文

网页核心内容的提取

信息检索 2014-03-11 v1

摘要

网页上可用的信息大多包含半结构化文本文档,这些文档以 XML、HTML 或 XHTML 格式表示,缺乏格式化的文档结构。文档无法区分表示文本的文本本身与其模式。此外,用于表示文本的结构量取决于文本文档的目的和大小。半结构化文档未应用任何语义。这需要提取文本文档的核心内容,以分析单词或句子从而生成有用的知识。本文讨论了几种用于从半结构化文本文档中提取核心内容的技术和方法,并分析了它们的优缺点。

关键词

引用

@article{arxiv.1403.1939,
  title  = {Extraction of Core Contents from Web Pages},
  author = {Sandeep Sirsat},
  journal= {arXiv preprint arXiv:1403.1939},
  year   = {2014}
}

备注

6 Pages, 3 Figures, 11 references. arXiv admin note: text overlap with arXiv:1207.0246 by other authors without attribution