中文

策略竞合解释了上下文学习的涌现与瞬时性

机器学习 2025-03-11 v2

摘要

上下文学习 (In-context learning, ICL) 是在 Transformer 模型中涌现的一种强大能力,使它们能够在不更新权重的情况下从上下文中学习。最近的工作将涌现的 ICL 确立为一种瞬时现象,有时会在长时间训练后消失。在这项工作中,我们寻求对这些瞬态动力学的机制性理解。首先,我们发现,在 ICL 消失后,渐近策略是权重内学习和上下文学习之间的一种显著的混合体,我们将其称为“上下文约束的权重内学习” (context-constrained in-weights learning, CIWL)。CIWL 与 ICL 竞争,并最终取代它成为模型的主导策略(从而导致 ICL 的瞬时性)。然而,我们也发现这两种竞争策略实际上共享子电路,这也产生了合作动力学。例如,在我们的设置中,ICL 无法独自快速涌现,只能通过渐近 CIWL 的同时缓慢发展来启用。因此,CIWL 既与 ICL 合作又与 ICL 竞争,我们将这种现象称为“策略竞合”。我们提出了一个最小数学模型来重现这些关键动力学和相互作用。在此模型的指导下,我们能够确定一种 ICL 真正涌现且持久的设置。

关键词

引用

@article{arxiv.2503.05631,
  title  = {Strategy Coopetition Explains the Emergence and Transience of In-Context Learning},
  author = {Aaditya K. Singh and Ted Moskovitz and Sara Dragutinovic and Felix Hill and Stephanie C. Y. Chan and Andrew M. Saxe},
  journal= {arXiv preprint arXiv:2503.05631},
  year   = {2025}
}

备注

20 pages, 18 figures