中文

用于野外检测儿童的手动标注图像-标题数据集

计算机视觉与模式识别 2025-06-13 v1 新兴技术

摘要

平台和法律对描绘未成年人(定义为18岁以下个体)的数字内容与其他类型内容的监管方式不同。鉴于需要评估的内容量巨大,基于机器学习的自动化工具常被用于检测描绘未成年人的内容。据我们所知,目前尚不存在用于在多模态环境中检测这些识别方法的数据集或基准。为了填补这一空白,我们发布了图像-标题儿童野外数据集(Image-Caption Children in the Wild Dataset, ICCWD),这是一个旨在为检测描绘未成年人的工具提供基准的图像-标题数据集。我们的数据集比之前的儿童图像数据集更丰富,包含各种情境下的儿童图像,包括虚构描绘和部分可见的身体。ICCWD包含10,000个图像-标题对,手动标注以指示图像中是否存在儿童。为了展示我们数据集的潜在用途,我们用它对三种不同的检测器进行了基准测试,包括应用于图像的商用年龄估计系统。我们的结果表明,儿童检测是一项具有挑战性的任务,最好的方法实现了75.3%的真正例率。我们希望我们数据集的发布将有助于在广泛场景中设计更好的未成年人检测方法。

关键词

引用

@article{arxiv.2506.10117,
  title  = {A Manually Annotated Image-Caption Dataset for Detecting Children in the Wild},
  author = {Klim Kireev and Ana-Maria Creţu and Raphael Meier and Sarah Adel Bargal and Elissa Redmiles and Carmela Troncoso},
  journal= {arXiv preprint arXiv:2506.10117},
  year   = {2025}
}

备注

14 pages, 6 figures