中文

从 LLM 激活中提取段落

计算与语言 2024-09-11 v1

摘要

生成式大语言模型(LLM)在自然语言处理任务中表现卓越,但其内部工作机制在词元级别预测之外仍鲜有探索。本研究考察了这些模型在段落起始时是否决定其内容,从而揭示其情境理解能力。通过检查单词元激活中编码的信息,具体针对“\textbackslash n\textbackslash n”双换行符词元,我们展示了对这些激活进行补丁化(patching)可以传递关于后续段落情境的显著信息,进一步深化了对模型向前规划能力的认识。

关键词

引用

@article{arxiv.2409.06328,
  title  = {Extracting Paragraphs from LLM Token Activations},
  author = {Nicholas Pochinkov and Angelo Benoit and Lovkush Agarwal and Zainab Ali Majid and Lucile Ter-Minassian},
  journal= {arXiv preprint arXiv:2409.06328},
  year   = {2024}
}