CASTLE: 评估大型语言模型中面向学生的个性化安全性的综合基准
计算与语言
2026-02-06 v1
摘要
大型语言模型(LLM)推动了教育中个性化学习的发展。然而,其固有的生成机制通常会对相同的提示产生同质化的响应。这种一刀切的机制忽视了学生在认知和心理上的显著异质性,从而对弱势群体构成潜在的安全风险。现有的安全评估主要依赖于上下文无关的指标,如事实准确性、偏见或毒性,这些指标未能捕捉到相同响应可能因学生属性不同而造成的不同危害。为弥补这一空白,我们提出了面向学生的个性化安全性概念,并基于教育理论构建了CASTLE。该基准涵盖15种教育安全风险和14种学生属性,包含92,908个双语场景。我们进一步设计了三个评估指标:风险敏感性,衡量模型检测风险的能力;情感共情,评估模型识别学生状态的能力;以及学生对齐,评估模型响应与学生属性的匹配程度。在18个SOTA LLM上的实验表明,CASTLE构成了重大挑战:所有模型的安全平均评分均低于2.3分(满分5分),表明在个性化安全保障方面存在显著缺陷。
引用
@article{arxiv.2602.05633,
title = {CASTLE: A Comprehensive Benchmark for Evaluating Student-Tailored Personalized Safety in Large Language Models},
author = {Rui Jia and Ruiyi Lan and Fengrui Liu and Zhongxiang Dai and Bo Jiang and Jing Shao and Jingyuan Chen and Guandong Xu and Fei Wu and Min Zhang},
journal= {arXiv preprint arXiv:2602.05633},
year = {2026}
}