中文

字符串核能否经受住母语识别中时间的考验?

计算与语言 2017-08-07 v2

摘要

我们描述了一种用于 2017 年母语识别(NLI)共享任务的机器学习方法。该方法使用多核学习结合了多个核。虽然我们的大多数核基于从文章或语音转录中提取的字符 p-gram(也称为 n-gram),但我们也使用了一个基于 i-vector 的核,i-vector 是共享任务组织者提供的音频录音的低维表示。在学习阶段,我们选择核判别分析(KDA)而不是岭回归(KRR),因为前者在开发集上获得了比后者更好的结果。在我们之前的工作中,我们使用了类似的机器学习方法来取得 NLI 的最佳结果。本文的目的是证明我们基于字符串核的浅层简单方法(带有微小改进)能够经受住时间的考验,尽管自然语言处理近期取得了进展,仍能在 2017 年 NLI 共享任务中达到最佳性能。我们参加了所有三个赛道,在这些赛道中,参赛者可以仅使用文章(文章赛道)、仅使用语音转录(语音赛道)或两者兼用(融合赛道)。仅使用组织者提供的数据来训练我们的模型,我们在封闭文章赛道中达到了 86.95% 的宏 F1 分数,在封闭语音赛道中达到了 87.55% 的宏 F1 分数,在封闭融合赛道中达到了 93.19% 的宏 F1 分数。凭借这些分数,我们的团队(UnibucKernel)在所有三个赛道中均位列第一梯队,并在语音和融合赛道中取得了最佳分数。

关键词

引用

@article{arxiv.1707.08349,
  title  = {Can string kernels pass the test of time in Native Language Identification?},
  author = {Radu Tudor Ionescu and Marius Popescu},
  journal= {arXiv preprint arXiv:1707.08349},
  year   = {2017}
}

备注

In Proceedings of the 12th Workshop on Building Educational Applications Using NLP, 2017