中文

COSMIC:LLM 激活中广义拒绝方向的识别

计算与语言 2025-06-03 v1 人工智能

摘要

大型语言模型(LLM)在其激活空间中编码了诸如拒绝等行为,然而识别这些行为仍然是一项重大挑战。现有方法通常依赖于在输出 token 中可检测到的预定义拒绝模板,或需要人工分析。我们引入了 \textbf{COSMIC}(Cosine Similarity Metrics for Inversion of Concepts),这是一个自动化的方向选择框架,它使用余弦相似度来识别可行的引导方向和目标层——完全独立于模型输出。COSMIC 实现了与先前方法相当的引导性能,而无需对模型的拒绝行为(例如特定拒绝 token 的存在)做出假设。它在对抗性环境和弱对齐模型中可靠地识别拒绝方向,并能够引导此类模型走向更安全的行为,同时虚假拒绝的增加极少,展示了在广泛对齐条件下的鲁棒性。

关键词

引用

@article{arxiv.2506.00085,
  title  = {COSMIC: Generalized Refusal Direction Identification in LLM Activations},
  author = {Vincent Siu and Nicholas Crispino and Zihao Yu and Sam Pan and Zhun Wang and Yang Liu and Dawn Song and Chenguang Wang},
  journal= {arXiv preprint arXiv:2506.00085},
  year   = {2025}
}

备注

9 pages, Accepted to ACL 2025 Findings