Safe-Child-LLM:面向儿童-LLM交互的LLM安全性评估发展性基准测试
计算机与社会
2026-05-26 v4
摘要
随着大语言模型(LLM)越来越多地应用于儿童和青少年使用的场景,确保安全且适合年龄的交互已成为紧迫的伦理要求。尽管人工智能安全领域取得了进展,但当前的评估主要面向成人,忽视了未成年人与生成式AI交互时的独特脆弱性。我们提出了Safe-Child-LLM,一个全面的基准测试和数据集,用于系统性地评估LLM在两个发展阶段上的安全性:儿童(7-12岁)和青少年(13-17岁)。我们的框架包含一个新颖的多部分数据集,涵盖200个对抗性提示,这些提示来自红队测试语料库(如SG-Bench、HarmBench),并带有越狱成功的人类标注标签以及标准化的0-5伦理拒绝量表。我们评估了主流LLM——包括ChatGPT、Claude、Gemini、LLaMA、DeepSeek、Grok、Vicuna和Mistral——发现了面向儿童场景中的关键安全缺陷。本工作强调了社区驱动基准测试在保护LLM交互中年轻用户方面的必要性。为促进伦理AI开发中的透明度和协作进步,我们公开发布了基准数据集和评估代码库,地址为https://github.com/The-Responsible-AI-Initiative/Safe_Child_LLM_Benchmark.git
引用
@article{arxiv.2506.13510,
title = {Safe-Child-LLM: A Developmental Benchmark for Evaluating LLM Safety in Child-LLM Interactions},
author = {Junfeng Jiao and Saleh Afroogh and Kevin Chen and Abhejay Murali and David Atkinson and Amit Dhurandhar},
journal= {arXiv preprint arXiv:2506.13510},
year = {2026}
}