大语言模型可控性如何?基于行为细粒度的统一评估
计算与语言
2026-04-14 v2 人工智能
人机交互
机器学习
摘要
大语言模型 (LLMs) 正在被部署到社会敏感领域,但其从不一致的意图到不稳定的性格人格等不可预测行为,构成了显著的风险。我们提出 SteerEval,一个用于评估 LLMs 可控性的分层基准,覆盖语言特征、情感和人格三个维度。每个维度被结构化为三个规格层级:L1 (表达什么),L2 (如何表达),L3 (如何实例化),将高层行为意图与具体文本输出相连接。通过 SteerEval,我们系统评估了当代驾驶方法,发现控制在更细粒度层级上常常退化。我们的基准提供了一个原则且可解释的框架,用于安全可控的 LLM 行为,为未来研究提供了基础。
引用
@article{arxiv.2603.02578,
title = {How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities},
author = {Ziwen Xu and Kewei Xu and Haoming Xu and Haiwen Hong and Longtao Huang and Hui Xue and Ningyu Zhang and Yongliang Shen and Guozhou Zheng and Huajun Chen and Shumin Deng},
journal= {arXiv preprint arXiv:2603.02578},
year = {2026}
}
备注
ACL 2026