中文

通过约束参数区域能否确保LLM安全性

机器学习 2026-02-23 v1 人工智能 信息检索

摘要

大语言模型(LLMs)常被假设包含‛safety regions”——其修改直接影响安全行为的参数子集。我们对四种安全区域识别方法进行系统评估,这些方法涵盖不同的参数粒度,从单个权重到整个Transformer层,跨越四类不同规模的 backbone LLMs。使用十个安全识别数据集,我们发现识别出的安全区域仅 exhibits low to moderate overlap,即IoU。当进一步使用实用数据集(\ie non-harmful queries)细化安全区域时,重叠度显著下降。这些结果表明,当前技术未能可靠识别稳定、数据无关的安全区域。

关键词

引用

@article{arxiv.2602.17695,
  title  = {EXACT: Explicit Attribute-Guided Decoding-Time Personalization},
  author = {Xin Yu and Hanwen Xing and Lingzhou Xue},
  journal= {arXiv preprint arXiv:2602.17695},
  year   = {2026}
}