机器学习在摩尔达维亚语与罗马尼亚语方言识别中不合常理的有效性
计算与语言
2021-11-16 v3
摘要
受机器学习模型在摩尔达维亚语与罗马尼亚语方言识别中看似很高的准确率水平以及该课题日益增长的研究兴趣所推动,我们对 VarDial 2019 评测活动的摩尔达维亚语与罗马尼亚语跨方言主题识别(MRC)共享任务进行了后续研究。该共享任务包含两类子任务:一类是区分摩尔达维亚语与罗马尼亚语方言,另一类是在罗马尼亚语两种方言间按主题对文档分类。参与者取得了令人印象深刻的分数,例如摩尔达维亚语与罗马尼亚语方言识别的顶尖模型获得了 0.895 的宏 F1 分数。我们进行了人工标注者的主观评估,显示人类达到的准确率远低于机器学习(ML)模型。因此,参与者所提方法为何能达到如此高准确率仍不清楚。我们的目标是理解(i)所提方法为何如此有效(通过可视化判别特征),以及(ii)这些方法在多大程度上能保持其高准确率水平,例如当我们将文本样本缩短为单句或在推断时使用推文时。我们工作的次要目标是利用集成学习提出一种改进的 ML 模型。我们的实验表明,ML 模型能准确识别方言,即使在句子层面和跨不同领域(新闻文章 versus 推文)也是如此。我们还分析了性能最佳模型的最具判别性的特征,对这些模型所做出决策背后的某些原因提供解释。有趣的是,我们学到了先前未知于我们或人工标注者的新方言模式。此外,我们开展的实验表明,通过基于堆叠的集成可改进 MRC 共享任务上的机器学习性能。
引用
@article{arxiv.2007.15700,
title = {The Unreasonable Effectiveness of Machine Learning in Moldavian versus Romanian Dialect Identification},
author = {Mihaela Găman and Radu Tudor Ionescu},
journal= {arXiv preprint arXiv:2007.15700},
year = {2021}
}
备注
Accepted in International Journal of Intelligent Systems