通过次概念探测探讨大语言模型中有害性的几何结构
人工智能
2025-07-30 v1
摘要
近期大型语言模型(LLM)的进步加剧了理解和可靠控制其有害行为的需求。我们引入了一个多维框架,用于探测和引导模型内部的有害内容。对于55个不同的有害性次概念(例如种族仇恨、就业诈骗、武器),我们学习线性探测器,获得55个可解释的激活空间方向。这些方向共同构成了一个引人注目的低秩有害性子空间。我们 then 测试了从模型内部消除整个子空间,以及在子空间的主导方向上的引导和消除。我们发现,主导方向的引导允许在效用降低的情况下几乎消除有害性。我们的发现推进了对概念子空间提供可扩展视角的新兴观点,并为社区提供了审计和强化未来语言模型生成的实用工具。
引用
@article{arxiv.2507.21141,
title = {The Geometry of Harmfulness in LLMs through Subconcept Probing},
author = {McNair Shah and Saleena Angeline and Adhitya Rajendra Kumar and Naitik Chheda and Kevin Zhu and Vasu Sharma and Sean O'Brien and Will Cai},
journal= {arXiv preprint arXiv:2507.21141},
year = {2025}
}