中文

ParaScopes: 语言模型激活编码关于未来文本的什么信息?

计算与语言 2025-11-04 v1 机器学习

摘要

语言模型的可解释性研究通常探讨前向表示的激活情况。然而,随着语言模型在处理更长时间范围任务方面日益有能力,理解激活的方法往往仍受限于测试特定概念或标记。我们发展了残差流解码器作为探针模型激活,用于检测段落规模和文档规模的计划。我们测试了几种方法,发现信息可解码等效于 5+ 个未来上下文的标记。这些结果为更好地监控语言模型及更好地理解它们如何编码更长期计划信息奠定了基础。

关键词

引用

@article{arxiv.2511.00180,
  title  = {ParaScopes: What do Language Models Activations Encode About Future Text?},
  author = {Nicky Pochinkov and Yulia Volkova and Anna Vasileva and Sai V R Chereddy},
  journal= {arXiv preprint arXiv:2511.00180},
  year   = {2025}
}

备注

Main paper: 9 pages, 10 figures. Total 24 pages