无需更新的深层见解:洞察在上下文学习中的力量优于微调
机器学习
2024-10-08 v1 计算与语言
摘要
微调和上下文学习(ICL)是为大型语言模型赋予任务特定知识的两种常见方法。人们常认为在充足的训练样本下,微调可以超过 ICL,因为它允许模型根据数据调整其内部参数。然而,本文提出了一种反直觉发现:对于具有隐式模式的任务,ICL 能显著优于微调。我们开发了几个包含隐式模式的数据集,如由奇偶性决定答案的序列或识别计算中可约简项的数据集。然后我们在参数从 0.5B 到 7B 的模型上评估了这两种方法在模型对这些模式的理解情况。结果表明,采用 ICL 的模型能够快速把握深层模式并显著提高准确率。相比之下,尽管微调使用的训练样本是 ICL 的数千倍,�仅实现了有限的改进。我们还从机制可解释性视角提出了电路位移理论,以解释为何 ICL 获胜。
引用
@article{arxiv.2410.04691,
title = {Deeper Insights Without Updates: The Power of In-Context Learning Over Fine-Tuning},
author = {Qingyu Yin and Xuzheng He and Luoao Deng and Chak Tou Leong and Fan Wang and Yanzhao Yan and Xiaoyu Shen and Qiang Zhang},
journal= {arXiv preprint arXiv:2410.04691},
year = {2024}
}
备注
EMNLP'24 Findings