中文

表征工程:一种自上而下的 AI 透明化方法

机器学习 2025-03-04 v4 人工智能 计算与语言 计算机视觉与模式识别 计算机与社会

摘要

本文中,我们识别并刻画了新兴的表征工程(RepE)领域,这是一种借鉴认知神经科学见解以增强 AI 系统透明性的方法。RepE 将群体级表征而非神经元或回路作为分析核心,为我们提供了监测和操控深度神经网络(DNNs)中高层认知现象的新方法。我们提供了 RepE 技术的基线方法与初步分析,表明其为实现对大语言模型的理解与控制提供了简单而有效的方案。我们展示了这些方法如何为一系列与安全相关的问题提供抓手,包括诚实性、无害性、权力寻求等,证明了自上而下透明性研究的前景。我们希望本工作催化对 RepE 的进一步探索,并推动 AI 系统透明性与安全性的进步。

关键词

引用

@article{arxiv.2310.01405,
  title  = {Representation Engineering: A Top-Down Approach to AI Transparency},
  author = {Andy Zou and Long Phan and Sarah Chen and James Campbell and Phillip Guo and Richard Ren and Alexander Pan and Xuwang Yin and Mantas Mazeika and Ann-Kathrin Dombrowski and Shashwat Goel and Nathaniel Li and Michael J. Byun and Zifan Wang and Alex Mallen and Steven Basart and Sanmi Koyejo and Dawn Song and Matt Fredrikson and J. Zico Kolter and Dan Hendrycks},
  journal= {arXiv preprint arXiv:2310.01405},
  year   = {2025}
}

备注

Code is available at https://github.com/andyzoujm/representation-engineering