利用自监督学习进行儿童性虐待图像的场景分类
计算机视觉与模式识别
2025-11-25 v2 人工智能
计算机与社会
机器学习
摘要
21 世纪的犯罪分为虚拟世界和现实世界。然而,前者已成为后者中人们福祉和安全的全球威胁。它带来的挑战必须通过全球统一合作来应对,我们必须比以往任何时候都更加依赖自动化且值得信赖的工具来打击不断增长的在线犯罪。每年有超过 1000 万份儿童性虐待报告提交给美国国家失踪与受虐儿童中心,其中超过 80% 来自在线来源。因此,调查中心无法手动处理并正确调查所有图像。有鉴于此,能够安全高效地处理这些数据的可靠自动化工具至关重要。在这个意义上,场景分类任务在环境中寻找上下文线索,能够对儿童性虐待数据进行分组和分类,而无需在敏感材料上进行训练。处理儿童性虐待图像的稀缺性和局限性促使我们采用自监督学习,这是一种利用未标记数据生成强大表示的机器学习方法,可以更容易地将其转移到下游任务中。这项工作表明,在以场景为中心的数据上预训练的自监督深度学习模型在我们的室内场景分类任务中可以达到 71.6% 的平衡准确率,并且平均比完全监督版本性能好 2.2 个百分点。我们与巴西联邦警察专家合作,在实际儿童虐待材料上评估了我们的室内分类模型。结果表明,广泛使用的场景数据集中观察到的特征与敏感材料中描绘的特征之间存在显著差异。
引用
@article{arxiv.2403.01183,
title = {Leveraging Self-Supervised Learning for Scene Classification in Child Sexual Abuse Imagery},
author = {Pedro H. V. Valois and João Macedo and Leo S. F. Ribeiro and Jefersson A. dos Santos and Sandra Avila},
journal= {arXiv preprint arXiv:2403.01183},
year = {2025}
}
备注
13 pages, 5 figures, 4 tables. Under review