中文

稀疏自编码器揭示大语言模型中的时序差学习

机器学习 2024-10-03 v1

摘要

在上下文学习——即基于输入提示中少数示例进行适应的能力——是大型语言模型 (LLM) 的常见特征。然而,随着 LLM 在上下文学习方面能力的不断提升,理解这一现象的机制变得日益重要。特别是,LLM 如何在特定问题类别(如强化学习 (RL) 问题)中进行上下文学习尚不清楚。通过三个不同任务,我们首先表明 Llama 3 70B 可以在上下文中解决简单 RL 问题。随后,我们使用稀疏自编码器 (SAE) 对 Llama 的残差流进行分析,发现这些表示与时序差 (TD) 错误高度吻合。值得注意的是,这些表示虽然模型仅被训练用于预测下一个标记,却仍然出现。通过对这些表示进行精心设计的干预,我们验证了这些表示在 TD 错误和 Q 值计算中确实在起因性作用。综上所述,我们的工作为利用 SAE 研究和操控上下文学习提供了一种方法,为更深入的机制理解铺平了道路。

关键词

引用

@article{arxiv.2410.01280,
  title  = {Sparse Autoencoders Reveal Temporal Difference Learning in Large Language Models},
  author = {Can Demircan and Tankred Saanum and Akshay K. Jagadish and Marcel Binz and Eric Schulz},
  journal= {arXiv preprint arXiv:2410.01280},
  year   = {2024}
}