从 LLM 激活中提取段落
计算与语言
2024-09-11 v1
摘要
生成式大语言模型(LLM)在自然语言处理任务中表现卓越,但其内部工作机制在词元级别预测之外仍鲜有探索。本研究考察了这些模型在段落起始时是否决定其内容,从而揭示其情境理解能力。通过检查单词元激活中编码的信息,具体针对“\textbackslash n\textbackslash n”双换行符词元,我们展示了对这些激活进行补丁化(patching)可以传递关于后续段落情境的显著信息,进一步深化了对模型向前规划能力的认识。
引用
@article{arxiv.2409.06328,
title = {Extracting Paragraphs from LLM Token Activations},
author = {Nicholas Pochinkov and Angelo Benoit and Lovkush Agarwal and Zainab Ali Majid and Lucile Ter-Minassian},
journal= {arXiv preprint arXiv:2409.06328},
year = {2024}
}