迈向 AI 模型的通用引导与监测
计算与语言
2025-05-30 v2 人工智能
机器学习
摘要
现代 AI 模型包含了大量人类知识,但对其内部表征的理解仍不清晰。刻画这种表征的结构与性质将有助于提升模型能力并开发有效的安全防护措施。基于特征学习的最新进展,我们开发了一种有效且可扩展的方法,用于在大规模 AI 模型(语言模型、视觉-语言模型和推理模型)中提取通用概念的线性表征。我们展示了这些表征如何实现模型引导,通过引导我们暴露了漏洞、缓解了错位行为并提升了模型能力。此外,我们证明概念表征在不同人类语言之间具有显著的可迁移性,并且可以组合以实现多概念引导。通过对数百个概念的定量分析,我们发现更新、更大的模型更具可引导性,且引导可以超越标准提示提升模型能力。我们展示了概念表征如何有效监测错位内容(幻觉、有毒内容)。我们证明,使用概念表征构建的预测模型在监测错位内容方面比直接判断输出的模型更准确。总之,我们的结果说明了利用内部表征来映射 AI 模型中的知识、推进 AI 安全并提升模型能力的强大力量。
引用
@article{arxiv.2502.03708,
title = {Toward universal steering and monitoring of AI models},
author = {Daniel Beaglehole and Adityanarayanan Radhakrishnan and Enric Boix-Adserà and Mikhail Belkin},
journal= {arXiv preprint arXiv:2502.03708},
year = {2025}
}