中文

毒性活着哪里?语言模型中的机械局部化与针对性抑制

计算与语言 2026-05-28 v1 人工智能 机器学习

摘要

大型语言模型经常生成有毒、仇恨或有害的内容,但现有的缓解方法依赖于高成本的重新训练或输出级别的过滤,无法从机制上洞察毒性 originates internally。我们引入 Meow2X 和 TRNE 两个互补的无重新训练框架,通过分析有毒提示与中性提示之间的激活差异,将毒性局部化到特定层和神经元,然后通过推理时缩放或最小秩一权重编辑进行抑制——无需梯度下降。评估覆盖五个语言模型、两个基准和 90 个配置,使用双安全评估器显示在保持语言建模质量的同时实现一致的毒性降低。我们的分析表明,毒性在早期 MLP 层中被不成比例地编码,跨架构有所不同,并且在单评估器设置下被系统性地低估——这凸显了需要多评估器安全评估的重要性。通过将机制可解释性与实际去毒相结合,我们的框架为通往更安全、更透明的语言模型提供了原则方法。

关键词

引用

@article{arxiv.2605.27997,
  title  = {Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models},
  author = {Himanshu Beniwal and Mayank Singh},
  journal= {arXiv preprint arXiv:2605.27997},
  year   = {2026}
}