中文

LLMScan:基于因果分析的 LLM 不当行为检测

人工智能 2025-05-27 v4 计算与语言 机器学习

摘要

尽管大型语言模型(LLM)在各个领域取得了显著成功,但其生成不实、偏见和有害响应的潜力仍然引发了显著风险,尤其是在关键应用中。这凸显了系统性检测和预防此类不当行为的迫切需求。虽然现有方法针对特定问题(如有害响应)进行检测,但本工作提出了 LLMScan,这是一种基于因果推断的创新型 LLM 监控技术,为全面解决方案提供了方法。LLMScan 通过因果推断的视角系统性地监控 LLM 的内部工作原理,基于 LLM 的“大脑”在不当行为时表现不同这一前提。通过分析 LLM 输入标记和 Transformer 层的因果贡献,LLMScan 有效检测了不当行为。广泛的实验在各种任务和模型之间揭示了正常行为与不当行为之间因果分布的明显区别,使我们能够为各种不当行为检测任务开发出准确、轻量级的检测器。

关键词

引用

@article{arxiv.2410.16638,
  title  = {LLMScan: Causal Scan for LLM Misbehavior Detection},
  author = {Mengdi Zhang and Kai Kiat Goh and Peixin Zhang and Jun Sun and Rose Lin Xin and Hongyu Zhang},
  journal= {arXiv preprint arXiv:2410.16638},
  year   = {2025}
}