CR4T:面向青少年 LLM 安全的重写型防护
计算与语言
2026-05-22 v1 人工智能
计算机与社会
摘要
大语言模型(LLM)正日益嵌入青少年数字环境中,中介信息寻求、建议和情感敏感交互。然而,现有的安全机制仍主要基于成人规范,运作方式通过拒绝导向的抑制来实现安全。虽然此类方法可能减少即时政策违规,但也会创建对话死角、限制建设性指导,并无法解决青少年-AI 交互所固有的发展 vulnerability。我们认为,青少年 LLM 安全不应仅被视为过滤问题,而应当作为一种社会技术、发展导向的转换问题来操作化。为此,我们提出 Critique-and-Revise-for-Teenagers(CR4T),一个模型无关的保护框架,通过选择性重构不安全或拒绝风格的输出为符合年龄水平、以指导为导向的响应,同时保留善意意图。CR4T 结合轻量级风险检测与领域条件重写,以去除风险放大内容、减少不必要的对话关闭,并引入发展适当的指导。实验结果显示,针对性的重写显著减少了不安全和拒绝导向的结果,同时避免对可接受交互的不必要干预。这些发现表明,选择性响应重构为面向青少年 LLM 系统提供比拒绝中心防护更加以人类为中心的替代方案。
引用
@article{arxiv.2605.21609,
title = {CR4T: Rewrite-Based Guardrails for Adolescent LLM Safety},
author = {Heajun An and Qi Zhang and Vedanth Achanta and Jin-Hee Cho},
journal= {arXiv preprint arXiv:2605.21609},
year = {2026}
}