面向波兰边防部队的犯罪文本检测
计算与语言
2021-08-25 v1
摘要
本文描述了针对互联网上出现的波兰语犯罪文本的检测研究。我们进行了实验,以寻找对不平衡和噪声数据进行高效分类的最佳设置。当我们的模型在预训练的基于波兰语的 Transformer 语言模型上进行微调时,取得了最佳性能。对于检测任务,我们收集了一个大型的带标注互联网片段语料库作为训练数据。我们共享此数据集,并利用 Gonito 平台作为基准,创建了一个新的犯罪文本检测任务。
引用
@article{arxiv.2108.10580,
title = {Detection of Criminal Texts for the Polish State Border Guard},
author = {Artur Nowakowski and Krzysztof Jassem},
journal= {arXiv preprint arXiv:2108.10580},
year = {2021}
}
备注
Accepted for MIS2 workshop at KDD 2021