大语言模型与儿童安全:识别风险并提出安全的儿童-大语言模型交互保护框架
计算机与社会
2026-05-26 v7
摘要
大语言模型(LLMs)越来越多地被嵌入儿童相关场景,如教育、陪伴和创意工具,但其部署引发了安全、隐私、发展和安全风险。我们对儿童-LLM交互风险进行了系统性文献综述,并将发现组织成结构化图谱,区分(i)家长报告的担忧,(ii)经验记录的损害,以及(iii)感知风险与观察风险之间的差距。超越描述性列表,我们比较了调查、事件报告、青少年交互日志和治理指南中不同的证据流如何将“伤害”操作化,它们在何处冲突,以及它们暗示了哪些缓解措施。基于此综合,我们提出了一种保护框架,将儿童特定内容安全和发展敏感性结合针对对抗性滥用的安全级控制,包括提示注入和多模态越狱路径。该框架规定了可衡量的评估目标(如有害内容规避、年龄校准可读性、偏差公平性检查、提示注入鲁棒性和监控透明度),以支持开发者、教育工作者和政策制定者评估和改进儿童安全LLM部署。
引用
@article{arxiv.2502.11242,
title = {LLMs and Childhood Safety: Identifying Risks and Proposing a Protection Framework for Safe Child-LLM Interaction},
author = {Junfeng Jiao and Saleh Afroogh and Kevin Chen and Abhejay Murali and David Atkinson and Amit Dhurandhar},
journal= {arXiv preprint arXiv:2502.11242},
year = {2026}
}