中文

提示的几何学:揭示语言模型中任务适应的不同机制

计算与语言 2025-02-13 v1

摘要

解码器语言模型能够根据输入提示动态切换 various 计算任务。尽管提示已取得许多成功应用,但对这种灵活性内部机制的理解仍极有限。本文我们研究不同的提示方法如何影响这些模型中表示的几何结构。采用基于统计物理的框架,我们揭示了各种提示技术虽然实现相似的性能,但通过不同的表示机制进行任务适应。我们的分析突显了 few-shot in-context 学习中输入分布样本和标签语义在内在作用的关键作用。我们还展示了不同任务在表示层面存在协同与干扰相互作用的证据。本文为深化大型语言模型的理论理解,为开发更有效、基于表示的提示策略奠定了基础。

关键词

引用

@article{arxiv.2502.08009,
  title  = {The Geometry of Prompting: Unveiling Distinct Mechanisms of Task Adaptation in Language Models},
  author = {Artem Kirsanov and Chi-Ning Chou and Kyunghyun Cho and SueYeon Chung},
  journal= {arXiv preprint arXiv:2502.08009},
  year   = {2025}
}

备注

To appear in NAACL Findings 2025