中文

LLM密度估计:对In-Context学习轨迹的几何探索

机器学习 2025-03-05 v3 计算与语言 机器学习

摘要

大型语言模型(LLMs)在各种任务中表现出惊人的涌现能力,包括时间序列预测。本工作探讨了LLMs从数据在上下文中估计概率密度函数(PDF)的能力;这种密度估计(DE)是许多概率建模问题的基础任务。我们利用Intensive主成分分析(InPCA)来可视化和分析LLaMA-2模型的In-Context学习动力学。我们的主要发现是,这些LLMs在低维InPCA空间中遵循相似的学习轨迹,这些轨迹与传统密度估计方法(如直方图和高斯核密度估计(KDE))的轨迹不同。我们将LLM的In-Context DE过程解释为具有自适应核宽度和形状的KDE。这种自定义核模型虽然仅包含两个参数,却能捕获LLMA行为的显著部分。我们进一步推测了为何LLMA的核宽度和形状不同于经典算法的原因,提供了关于LLMs在上下文概率推理机制的见解。我们的代码库以及LLM In-Context学习轨迹的3D可视化已公开发布于https://github.com/AntonioLiu97/LLMICL_inPCA

关键词

引用

@article{arxiv.2410.05218,
  title  = {Density estimation with LLMs: a geometric investigation of in-context learning trajectories},
  author = {Toni J. B. Liu and Nicolas Boullé and Raphaël Sarfati and Christopher J. Earls},
  journal= {arXiv preprint arXiv:2410.05218},
  year   = {2025}
}