通过约束参数区域能否确保LLM安全性
机器学习
2026-02-23 v1 人工智能
信息检索
摘要
大语言模型(LLMs)常被假设包含‛safety regions”——其修改直接影响安全行为的参数子集。我们对四种安全区域识别方法进行系统评估,这些方法涵盖不同的参数粒度,从单个权重到整个Transformer层,跨越四类不同规模的 backbone LLMs。使用十个安全识别数据集,我们发现识别出的安全区域仅 exhibits low to moderate overlap,即IoU。当进一步使用实用数据集(\ie non-harmful queries)细化安全区域时,重叠度显著下降。这些结果表明,当前技术未能可靠识别稳定、数据无关的安全区域。
引用
@article{arxiv.2602.17695,
title = {EXACT: Explicit Attribute-Guided Decoding-Time Personalization},
author = {Xin Yu and Hanwen Xing and Lingzhou Xue},
journal= {arXiv preprint arXiv:2602.17695},
year = {2026}
}