中文

嵌入应嵌入什么?自回归模型表征潜在生成分布

机器学习 2026-01-09 v2 人工智能 计算与语言 机器学习

摘要

自回归语言模型已展现出从文本中提取潜在结构的惊人能力。大型语言模型的嵌入被证明能捕捉语言的语法和语义方面的特征。但嵌入应代表什么内容?我们将自回归预测目标与构建预测充分统计量以总结观测序列中所含信息相联系,并利用这一联系识别三个情景,其中嵌入的最优内容可被确定:独立同分布数据,此时嵌入应捕捉数据的充分统计量;潜在状态模型,此时嵌入应编码给定数据的后验分布;离散假设空间,此时嵌入应反映给定数据的后验分布。随后,我们进行经验性探针研究,表明transformer在这三类潜在生成分布中编码这些内容,并且在这些情景下表现良好,尤其是在无token记忆的情况下。

关键词

引用

@article{arxiv.2406.03707,
  title  = {What Should Embeddings Embed? Autoregressive Models Represent Latent Generating Distributions},
  author = {Liyi Zhang and Michael Y. Li and R. Thomas McCoy and Theodore R. Sumers and Jian-Qiao Zhu and Thomas L. Griffiths},
  journal= {arXiv preprint arXiv:2406.03707},
  year   = {2026}
}

备注

28 pages, 11 figures