中文

无需更新的深层见解:洞察在上下文学习中的力量优于微调

机器学习 2024-10-08 v1 计算与语言

摘要

微调和上下文学习(ICL)是为大型语言模型赋予任务特定知识的两种常见方法。人们常认为在充足的训练样本下,微调可以超过 ICL,因为它允许模型根据数据调整其内部参数。然而,本文提出了一种反直觉发现:对于具有隐式模式的任务,ICL 能显著优于微调。我们开发了几个包含隐式模式的数据集,如由奇偶性决定答案的序列或识别计算中可约简项的数据集。然后我们在参数从 0.5B 到 7B 的模型上评估了这两种方法在模型对这些模式的理解情况。结果表明,采用 ICL 的模型能够快速把握深层模式并显著提高准确率。相比之下,尽管微调使用的训练样本是 ICL 的数千倍,�仅实现了有限的改进。我们还从机制可解释性视角提出了电路位移理论,以解释为何 ICL 获胜。

关键词

引用

@article{arxiv.2410.04691,
  title  = {Deeper Insights Without Updates: The Power of In-Context Learning Over Fine-Tuning},
  author = {Qingyu Yin and Xuzheng He and Luoao Deng and Chak Tou Leong and Fan Wang and Yanzhao Yan and Xiaoyu Shen and Qiang Zhang},
  journal= {arXiv preprint arXiv:2410.04691},
  year   = {2024}
}

备注

EMNLP'24 Findings