Induction Heads是In-context Learning中模式匹配的关键机制
计算与语言
2025-04-03 v3
摘要
大型语言模型(LLMs)通过基于情境学习(ICL)展现出学习和执行复杂任务的惊人能力,但其内部机制的全面理解仍有缺失。本文探讨了induction heads在few-shot ICL情境中的作用。我们分析了Llama-3-8B和InternLM2-20B在抽象模式识别和NLP任务上的表现。我们的结果表明,即使对induction heads进行最小化剥离,也会导致抽象模式识别任务的ICL性能下降最高可达~32%,使性能接近随机水平。对于NLP任务,此剥离显著降低模型从示例中获益的能力,使few-shot ICL性能接近零-shot提示的性能。我们进一步使用注意力knockout来禁用特定的induction模式,并为induction机制在ICL中所起作用提供细粒度证据。
引用
@article{arxiv.2407.07011,
title = {Induction Heads as an Essential Mechanism for Pattern Matching in In-context Learning},
author = {Joy Crosbie and Ekaterina Shutova},
journal= {arXiv preprint arXiv:2407.07011},
year = {2025}
}
备注
9 pages, 7 figures; Code link added