用于区分相似语言的 N-gram 与神经语言模型
计算与语言
2017-08-14 v1
摘要
本文描述了我们提交至 2016 年区分相似语言(DSL)共享任务的系统(命名为 clac)。我们使用两种独立的机器学习技术参与了封闭子任务 1(集合 A)。第一种方法是基于字符的卷积神经网络结合双向长短期记忆(BiLSTM)层(CLSTM),在极少调参的情况下达到了 78.45% 的准确率。第二种方法是基于字符的 n-gram 模型。后一种方法达到了 88.45% 的准确率,接近最佳提交系统达到的 89.38% 的准确率,并使我们总排名位列第 7。
引用
@article{arxiv.1708.03421,
title = {N-gram and Neural Language Models for Discriminating Similar Languages},
author = {Andre Cianflone and Leila Kosseim},
journal= {arXiv preprint arXiv:1708.03421},
year = {2017}
}
备注
8 pages