中文

简化高度多语言文本挖掘应用开发的方法综述

计算与语言 2014-01-14 v1

摘要

多语言文本处理非常有用,因为不同语言中发现的信息内容是互补的,无论是在事实还是观点方面。虽然信息抽取和其他文本挖掘软件原则上可以为多种语言开发,但大多数文本分析工具仅应用于少量语言,因为每种语言的开发工作量很大。自训练工具显然缓解了这一问题,但即使是提供训练数据和手动调整结果的工作量通常也相当可观。在本文中,我们汇集了多位多语言系统开发者在如何最小化为多种语言开发自然语言处理应用的工作量方面的见解。我们还解释了我们自身在为数十种语言开发复杂文本挖掘软件的努力背后的主要指导原则。虽然这些原则——最重要的是:极度简单性——可能非常严格且具有限制性,但我们相信通过开发 Europe Media Monitor (EMM) 系列应用(http://emm.newsbrief.eu/overview.html)已经证明了该方法的可行性。EMM 是一套复杂的媒体监测工具,每天以 20 到 50 种语言处理和分析多达 100,000 篇在线新闻文章。我们还将触及能够使所有人更容易地开发高度多语言文本挖掘应用的语言资源类型。我们将论证——为实现这一目标——最需要的资源是免费、简单、平行且统一的多语言词典、语料库和软件工具。

关键词

引用

@article{arxiv.1401.2937,
  title  = {A survey of methods to ease the development of highly multilingual text mining applications},
  author = {Ralf Steinberger},
  journal= {arXiv preprint arXiv:1401.2937},
  year   = {2014}
}

备注

22 pages. Published online on 12 October 2011