开集语言识别
计算与语言
2017-07-18 v1
摘要
我们提出了首个使用单类分类的开集语言识别实验。我们首先强调了传统特征提取方法的缺点,并提出了一种基于哈希的特征向量化方法作为解决方案。使用来自不同书写系统的 10 种语言的数据集,我们仅用每种语言的单语语料库训练一个单类支持向量机。每个模型针对来自所有 10 种语言的数据测试集进行评估,我们取得了 0.99 的平均 F 值,凸显了该方法对于开集语言识别的有效性。
引用
@article{arxiv.1707.04817,
title = {Open-Set Language Identification},
author = {Shervin Malmasi},
journal= {arXiv preprint arXiv:1707.04817},
year = {2017}
}