中文

使用多过滤器架构的 Twitter 口语方言识别

计算与语言 2020-06-08 v1 机器学习

摘要

本文介绍了我们针对 SwissText & KONVENS 2020 共享任务 2 的方法,该任务是一个用于 Twitter 上瑞士德语(GSW)识别的多阶段神经模型。我们的模型输出 GSW 或非 GSW,并非用作通用语言识别器。我们的架构由两个独立的过滤器组成,第一个偏向召回率,第二个过滤器偏向精确率(均针对 GSW)。此外,我们的过滤器中未使用二分类模型(GSW 对比非 GSW),而是使用以 GSW 为可能标签之一的多类分类器。我们的模型在共享任务的测试集上达到了 0.982 的 F1 分数。

关键词

引用

@article{arxiv.2006.03564,
  title  = {Spoken dialect identification in Twitter using a multi-filter architecture},
  author = {Mohammadreza Banaei and Rémi Lebret and Karl Aberer},
  journal= {arXiv preprint arXiv:2006.03564},
  year   = {2020}
}