中文

开集语言识别

计算与语言 2017-07-18 v1

摘要

我们提出了首个使用单类分类的开集语言识别实验。我们首先强调了传统特征提取方法的缺点,并提出了一种基于哈希的特征向量化方法作为解决方案。使用来自不同书写系统的 10 种语言的数据集,我们仅用每种语言的单语语料库训练一个单类支持向量机。每个模型针对来自所有 10 种语言的数据测试集进行评估,我们取得了 0.99 的平均 F 值,凸显了该方法对于开集语言识别的有效性。

关键词

引用

@article{arxiv.1707.04817,
  title  = {Open-Set Language Identification},
  author = {Shervin Malmasi},
  journal= {arXiv preprint arXiv:1707.04817},
  year   = {2017}
}