语言模型中的即时与分布式任务表示
计算与语言
2025-12-03 v3 人工智能
摘要
语言模型许多令人瞩目的能力源于其上下文学习:基于指令或示例,它们可以在不更新权重的情况下推断并执行新任务。在本工作中,我们研究了语言模型中新任务的表示何时形成,以及这些表示在上下文过程中如何变化。我们研究了两种不同的任务表示:一种是“可迁移”的——即可以将任务上下文迁移到另一模型实例的向量表示,即使没有完整提示也可以;另一种是高层任务类别的简单表示。我们表明,可迁移任务表示以非单调且偶发的方式演化,而任务身份表示则贯穿整个上下文持续存在。具体而言,可迁移任务表示表现出双重局部性。当上下文中提供更多示例时,它们能成功压缩证据。但这一证据积累过程在序列维度上表现出强烈的时序局部性,仅在特定 token 上才生效——尽管任务身份在整个上下文中都能被可靠解码。在某些情况下,可迁移任务表示还表现出语义局部性,捕获一个小的任务“范围”,例如一个独立的子任务。因此,语言模型通过对任务的惰性、持续性敏感性和支持推理的主动、即时表示,实现了即时的新任务表示。
引用
@article{arxiv.2509.04466,
title = {Just-in-time and distributed task representations in language models},
author = {Yuxuan Li and Declan Campbell and Stephanie C. Y. Chan and Andrew Kyle Lampinen},
journal= {arXiv preprint arXiv:2509.04466},
year = {2025}
}