大语言模型中表示可塑性的时间线及分析
机器学习
2024-10-10 v1 人工智能
摘要
引导人工智能行为的能力对于防止其长期危险和灾难性潜力至关重要。表示工程(RepE)已成为一种新颖、强大的方法,用于在自上而下的层面引导内部模型行为,例如“诚实”。因此,理解表示的引导应置于对齐工作的前沿。不幸的是,目前在这一层面理解可塑性的努力被严重忽视。本文旨在弥合知识差距,理解大语言模型表示稳定性——特别是针对“诚实”概念——以及模型可塑性如何演变,通过应用在不同微调阶段提取的引导向量,揭示了模型行为变化的不同程度。这些发现至关重要,表明虽然早期引导表现出高可塑性,但后期阶段存在一个响应惊人的关键窗口。这种模式在不同模型架构中均有观察到,表明存在一种可用于有效干预的模型可塑性的一般模式。这些见解极大地促进了人工智能透明度领域的发展,解决了当前限制我们有效引导模型行为能力的效率不足问题。
引用
@article{arxiv.2410.06225,
title = {A Timeline and Analysis for Representation Plasticity in Large Language Models},
author = {Akshat Kannan},
journal= {arXiv preprint arXiv:2410.06225},
year = {2024}
}