在上下文学习任务中比较自底向上和自顶向下的引导方法
机器学习
2024-11-12 v1
摘要
大语言模型 (LLM) 可解释性研究的一个关键目标是开发稳健引导模型朝向期望行为的方法。为此,提出了两种截然不同的可解释性路径——‘自底向上’和‘自顶向下’,但两者之间鲜有定量对比。我们展示了一个案例研究,比较了每个分支的代表性向量引导方法的有效性:函数向量 (FV; arXiv:2310.15213) 作为自底向上方法,上下文向量 (ICV; arXiv:2311.06668) 作为自顶向下方法。虽然两者都旨在捕捉广泛上下文学习任务的紧凑表示,但我们发现它们仅在特定类型的任务上有效:ICV 在行为偏移方面优于 FV,而 FV 在需要更高精度的任务中表现出色。我们讨论了这些发现对未来引导方法评估以及自顶向下和自底向上引导进一步研究的启示。
引用
@article{arxiv.2411.07213,
title = {Comparing Bottom-Up and Top-Down Steering Approaches on In-Context Learning Tasks},
author = {Madeline Brumley and Joe Kwon and David Krueger and Dmitrii Krasheninnikov and Usman Anwar},
journal= {arXiv preprint arXiv:2411.07213},
year = {2024}
}