儿童的大语言模型安全
计算机与社会
2025-02-19 v1 人工智能
摘要
本文分析了大型语言模型(LLM)在与年龄小于18岁的儿童互动时的安全性。尽管大型语言模型在儿童生活的各个方面(如教育和治疗)具有变革性的应用,但仍存在对这一人群特定潜在内容伤害的理解和缓解之间的显著差距。该研究承认常被忽视的儿童的多样性,提出了一种全面的评估方法,专门针对儿童的LLM安全性。我们列举了儿童在使用由大型语言模型驱动的应用程序时可能遭遇的风险。此外,我们开发了反映儿童不同性格和兴趣的儿童用户模型,这些模型受儿童护理和心理学文献的启发。这些用户模型旨在弥合儿童安全文献在各个领域之间的现有差距。我们利用儿童用户模型对六种最先进的大型语言模型进行安全评估。我们的观察表明,大型语言模型在尤其针对儿童有害但不针对成人的类别方面存在显著的安全缺口。
引用
@article{arxiv.2502.12552,
title = {LLM Safety for Children},
author = {Prasanjit Rath and Hari Shrawgi and Parag Agrawal and Sandipan Dandapat},
journal= {arXiv preprint arXiv:2502.12552},
year = {2025}
}