中文

GPT 是如何逐层学习的

人工智能 2025-01-14 v1

摘要

大型语言模型 (LLM) 在语言处理、策略游戏和推理等任务中表现出色,但在构建适用于代理在复杂环境中做出自适应决策的通用内部表征方面存在挑战。为了有效地导航复杂环境,代理必须构建可靠的世界模型。尽管 LLM 在特定基准测试上表现良好,但常常难以泛化,导致表征脆弱,限制了其实际效果。理解 LLM 如何构建内部世界模型是开发能够在各种任务中实现一致、自适应行为的代理的关键。我们分析了 OthelloGPT,这是一个基于 GPT 的模型,专为学习 Othello 游戏而训练,作为研究表征学习的受控测试平台。尽管仅通过随机有效移动进行下一个标记的预测训练,OthelloGPT 仍显示出在理解棋盘状态和游戏过程中逐层的有意义进展。早期层捕获静态属性,如棋盘边缘,而更深层次则反映动态瓷砖变化。为了解释这些表征,我们比较了稀疏自编码器 (Sparse Autoencoders, SAEs) 和线性探针,发现 SAEs 提供更稳健、解耦的关于组成性特征的洞察,而线性探针主要检测对分类有用的特征。我们使用 SAEs 解码与瓷砖颜色和瓷砖稳定性相关的特征,后者是此前未考察的特征,反映了棋盘控制和长期规划等复杂游戏概念。我们研究了线性探针准确率和瓷砖颜色的进展,并使用 SAEs 和线性探针来比较它们在捕捉模型正在学习的内容方面的有效性。尽管我们从较小的语言模型开始,即 OthelloGPT,本研究为理解 GPT 模型、transformer 和 LLM 所学习的内部表征奠定了框架。我们的代码公开可用:https://github.com/ALT-JS/OthelloSAE。

关键词

引用

@article{arxiv.2501.07108,
  title  = {How GPT learns layer by layer},
  author = {Jason Du and Kelly Hong and Alishba Imran and Erfan Jahanparast and Mehdi Khfifi and Kaichun Qiao},
  journal= {arXiv preprint arXiv:2501.07108},
  year   = {2025}
}