理解幼儿代数字语言:LLM安全系统内容审核的评估
计算机与社会
2025-05-19 v1 人工智能
计算与语言
人机交互
摘要
本研究提供了对AI系统如何解释幼儿代(Gen Alpha,出生于2010-2024)数字语言的独特评估。作为首批与AI共同成长的世代,幼儿代面临新的线上风险,这些风险源于沉浸式数字参与以及其日益增长的沟通方式与现有安全工具之间的差距。他们独特的语言风格受游戏、表情包和AI驱动的趋势影响,往往隐藏了对人类监督员和自动化系统的有害互动。我们评估了四个领先的AI模型(GPT-4、Claude、Gemini和Llama 3)在检测Gen Alpha话语中被掩盖的骚扰和操纵方面的能力。该研究使用来自游戏平台、社交媒体和视频内容的100个最新表达,揭示了关键性理解失败,对在线安全具有直接影响。该工作贡献包括:(1)捕捉Gen Alpha表达的首创性数据集;(2)改进面向青少年保护的AI内容审核系统的框架;(3)包括AI系统、人类监督员和家长的多视角评估,并直接来自Gen Alpha共同研究员的输入;以及(4)分析语言分歧如何增加青少年的脆弱性。研究结果突显了有需紧急重新设计安全系统以适应青少年沟通方式的迫切需求,尤其鉴于Gen Alpha对成人无法理解其数字世界而不愿寻求帮助的态度。这一研究将幼儿代研究员的洞见与系统性学术分析相结合,以解决关键的数字安全挑战。
引用
@article{arxiv.2505.10588,
title = {Understanding Gen Alpha Digital Language: Evaluation of LLM Safety Systems for Content Moderation},
author = {Manisha Mehta and Fausto Giunchiglia},
journal= {arXiv preprint arXiv:2505.10588},
year = {2025}
}
备注
Accepted to ACM FAccT 2025. To be presented in Athens, June 2025, and published in the conference proceedings. Preprint version; final version will appear in the ACM Digital Library