用于识别儿童性剥削材料的短文本分类方法
信息检索
2020-11-16 v2 机器学习
摘要
制作或分享儿童性剥削材料(CSEM)是一种严重犯罪,执法机构(LEAs)予以严厉打击。当 LEA 从潜在的 CSEM 制作者或消费者处扣押计算机时,他们需要分析嫌疑人的硬盘文件以寻找证据。然而,手动检查文件内容以寻找 CSEM 是一项耗时任务。在大多数情况下,对于使用搜查令的西班牙警方而言,可用时间内的工作量难以完成。除分析内容外,可用于加速过程的另一种方法是通过分析文件名及其绝对路径来识别 CSEM。该任务的主要挑战在于处理材料所有者使用混淆词和用户自定义命名模式故意扭曲的短文本。本文提出并比较了两种基于短文本分类来识别 CSEM 文件的方法。第一种采用两个独立的监督分类器,分别用于文件名和路径,其输出随后融合为单一分数。相反,第二种方法仅使用文件名分类器在文件绝对路径上迭代。两种方法均在字符 n-gram 层面运作,而二元与正字法特征丰富了文件名表示,并使用二元 Logistic 回归模型进行分类。所提出的文件分类器达到了 0.98 的平均类别召回率。该解决方案可集成到取证工具与服务中,以支持执法机构在不处理每个文件视觉内容的情况下识别 CSEM,而后者在计算上要求高得多。
引用
@article{arxiv.2011.01113,
title = {Short Text Classification Approach to Identify Child Sexual Exploitation Material},
author = {Mhd Wesam Al-Nabki and Eduardo Fidalgo and Enrique Alegre and Rocío Alaiz-Rodríguez},
journal= {arXiv preprint arXiv:2011.01113},
year = {2020}
}