中文

向有效LLM理论迈进:一种表示学习方法

机器学习 2026-05-12 v1 人工智能

摘要

我们提出表征有效理论(RET),一个描述大型语言模型计算的框架,采用所学习的宏状态而非微观细节。RET通过基于BYOL/JEPA风格的自监督目标从隐藏状态轨迹中学习这些宏状态,将激活粗化为宏变量,保留与预测和解释相关的高阶结构。我们评估这些宏变量在可解释性方面的实际相关性:RET产生具有时序一致性的状态,揭示推理的“心理状态”轨迹,捕捉高阶语义结构,支持对行为结果如顺从性的早期预测,并为引导生成走向可解释计算阶段提供因果干预。综合这些结果表明,LLM计算可通过RET获得有用的有效描述:高水平、动态有意义的变量,支持解释、预测和干预。

关键词

引用

@article{arxiv.2605.09294,
  title  = {Towards Effective Theory of LLMs: A Representation Learning Approach},
  author = {Muhammed Ustaomeroglu and Guannan Qu},
  journal= {arXiv preprint arXiv:2605.09294},
  year   = {2026}
}

备注

Project webpage: https://ustaomeroglu.github.io/RET/