中文

万物皆可同时:大型语言模型能在单次推理中叠加学习多个上下文任务

机器学习 2024-10-10 v1 人工智能 计算与语言

摘要

大型语言模型(LLM)展现了卓越的上下文学习(ICL)能力。在本研究中,我们探索了一个与ICL相关的令人惊讶的现象:LLM可以在单次推理调用期间同时执行多个计算上不同的ICL任务,我们将这种能力称为“任务叠加”。我们提供了跨多种LLM家族和规模的这一现象的经验证据,并表明即使我们训练模型一次只学习一个ICL任务,这一现象也会出现。我们提供了理论解释,表明这种能力完全在Transformer的表达能力范围之内。我们还探讨了LLM如何在叠加过程中内部组合任务向量。此外,我们表明,更大的模型可以并行解决更多的ICL任务,并更好地校准其输出分布。我们的发现提供了对LLM潜在能力的见解,进一步证实了“LLM作为模拟器的叠加”这一观点,并引发了关于实现同时任务执行的机制的问题。

关键词

引用

@article{arxiv.2410.05603,
  title  = {Everything Everywhere All at Once: LLMs can In-Context Learn Multiple Tasks in Superposition},
  author = {Zheyang Xiong and Ziyang Cai and John Cooper and Albert Ge and Vasilis Papageorgiou and Zack Sifakis and Angeliki Giannou and Ziqian Lin and Liu Yang and Saurabh Agarwal and Grigorios G Chrysos and Samet Oymak and Kangwook Lee and Dimitris Papailiopoulos},
  journal= {arXiv preprint arXiv:2410.05603},
  year   = {2024}
}