中文

基于语言的多语言句子分类

cmp-lg 2016-08-31 v2 计算与语言

摘要

本文描述了一种句子分类方法,其独特之处在于基于语言的自然属性,无需训练集依赖。该实现速度快、体积小、鲁棒性强,且对文本错误具有容忍性。在法语、英语、西班牙语和德语的判别测试中,该系统给出了非常有趣的结果,在一次测试中达到了99.4%的正确分类率。其分辨能力基于语法词(非最常见词)和字母表。系统拥有每种语言的语法词和字母表后,对它们分别计算被选中的可能性。可能性最优的语言名称将标注该句子——但未解决的歧义将被保留。本文将讨论促使我们使用这些语言学事实的原因,并提出若干改进系统分类性能的方向。利用语言属性进行句子分类表明,困难的问题有时有简单的解决方案。

关键词

引用

@article{arxiv.cmp-lg/9502039,
  title  = {Multilingual Sentence Categorization according to Language},
  author = {Emmanuel Giguet},
  journal= {arXiv preprint arXiv:cmp-lg/9502039},
  year   = {2016}
}

备注

4 pages --- LaTeX