中文

面向波兰边防部队的犯罪文本检测

计算与语言 2021-08-25 v1

摘要

本文描述了针对互联网上出现的波兰语犯罪文本的检测研究。我们进行了实验,以寻找对不平衡和噪声数据进行高效分类的最佳设置。当我们的模型在预训练的基于波兰语的 Transformer 语言模型上进行微调时,取得了最佳性能。对于检测任务,我们收集了一个大型的带标注互联网片段语料库作为训练数据。我们共享此数据集,并利用 Gonito 平台作为基准,创建了一个新的犯罪文本检测任务。

关键词

引用

@article{arxiv.2108.10580,
  title  = {Detection of Criminal Texts for the Polish State Border Guard},
  author = {Artur Nowakowski and Krzysztof Jassem},
  journal= {arXiv preprint arXiv:2108.10580},
  year   = {2021}
}

备注

Accepted for MIS2 workshop at KDD 2021