利用无监督预训练与自动化特征工程进行波兰语低资源仇恨语音检测
计算与语言
2019-06-25 v1 机器学习
机器学习
摘要
本文介绍我们对 PolEval 2019 任务 6:仇恨语音与欺凌检测的参赛工作。我们描述了所采用的三种并行方法:将预训练的 ULMFiT 模型微调至我们的分类任务,将预训练的 BERT 模型微调至我们的分类任务,以及使用 TPOT 库寻找最优流水线。我们给出了这三种工具所取得的结果,并从用户体验角度评述其优缺点。我们的团队凭借 TPOT 发现的浅层模型——带有非平凡特征工程的逻辑回归分类器——在子任务 2 中获得第二名。
引用
@article{arxiv.1906.09325,
title = {Exploiting Unsupervised Pre-training and Automated Feature Engineering for Low-resource Hate Speech Detection in Polish},
author = {Renard Korzeniowski and Rafał Rolczyński and Przemysław Sadownik and Tomasz Korbak and Marcin Możejko},
journal= {arXiv preprint arXiv:1906.09325},
year = {2019}
}
备注
http://poleval.pl/publication