中文

面向压缩模型的拒绝机制理解与改进:基于机制可解释性

计算与语言 2025-04-08 v1 人工智能

摘要

大型语言模型的快速发展催生了通过模型压缩来提高可访问性和实用性的重要需求。尽管广泛研究了压缩模型的安全性,但发现对齐后的模型在压缩后常丢失可信度元素。同时,机制可解释性领域 gaining traction,发现单一残差流中的方向可跨架构调控拒绝行为。本文通过检查拒绝机制,采用新颖的可解释性视角评估压缩模型的安全性。进而利用可解释性分析所获见解,我们提出一种轻量、计算高效的方法,在不牺牲性能或实用性的前提下提升压缩模型的安全性。

关键词

引用

@article{arxiv.2504.04215,
  title  = {Towards Understanding and Improving Refusal in Compressed Models via Mechanistic Interpretability},
  author = {Vishnu Kabir Chhabra and Mohammad Mahdi Khalili},
  journal= {arXiv preprint arXiv:2504.04215},
  year   = {2025}
}