三思而后行:语言模型中检索任务的通用涌现分解
信息检索
2023-12-19 v1 计算与语言
机器学习
摘要
在解决具有挑战性的问题时,语言模型(LM)能够从长而复杂的上下文中识别相关信息。为了研究LM如何在多样化的情境中解决检索任务,我们引入了ORION,一个涵盖从文本理解到编码的六个领域的结构化检索任务集合。ORION中的每个任务都可以抽象地表示为一个请求(例如一个问题),该请求从上下文(例如一个故事)中检索一个属性(例如角色名称)。我们对18个开源语言模型(参数规模从1.25亿到700亿不等)进行了因果分析。我们发现LM内部以模块化方式分解检索任务:最后一个token位置的中间层处理请求,而后期层从上下文中检索正确的实体。在因果强制这种分解后,模型仍然能够解决原始任务,在106个研究的模型-任务对中的98个中保留了70%的原始正确token概率。我们通过对Pythia-2.8b上的问答任务进行细粒度案例研究,将我们的宏观分解与微观描述联系起来。基于我们的高层理解,我们展示了一个概念验证应用,用于对LM进行可扩展的内部监督以缓解提示注入,同时仅需对单个输入进行人工监督。我们的解决方案大幅提高了准确率(在Pythia-12b上从15.5%提高到97.5%)。这项工作提供了跨不同领域和模型的通用涌现模块化任务处理的证据,并且是将可解释性应用于LM可扩展内部监督的开创性努力。
引用
@article{arxiv.2312.10091,
title = {Look Before You Leap: A Universal Emergent Decomposition of Retrieval Tasks in Language Models},
author = {Alexandre Variengien and Eric Winsor},
journal= {arXiv preprint arXiv:2312.10091},
year = {2023}
}