使用多过滤器架构的 Twitter 口语方言识别
计算与语言
2020-06-08 v1 机器学习
摘要
本文介绍了我们针对 SwissText & KONVENS 2020 共享任务 2 的方法,该任务是一个用于 Twitter 上瑞士德语(GSW)识别的多阶段神经模型。我们的模型输出 GSW 或非 GSW,并非用作通用语言识别器。我们的架构由两个独立的过滤器组成,第一个偏向召回率,第二个过滤器偏向精确率(均针对 GSW)。此外,我们的过滤器中未使用二分类模型(GSW 对比非 GSW),而是使用以 GSW 为可能标签之一的多类分类器。我们的模型在共享任务的测试集上达到了 0.982 的 F1 分数。
引用
@article{arxiv.2006.03564,
title = {Spoken dialect identification in Twitter using a multi-filter architecture},
author = {Mohammadreza Banaei and Rémi Lebret and Karl Aberer},
journal= {arXiv preprint arXiv:2006.03564},
year = {2020}
}