中文

通过提示完全循环模型实现通用上下文近似

机器学习 2024-10-11 v2 人工智能 计算与语言

摘要

零样本学习和上下文学习使得无需微调模型即可解决任务,这对于开发生成模型解决方案至关重要。因此,理解预训练模型是否可以通过提示来近似任意函数(即它是否是通用上下文近似器)至关重要。虽然最近的研究表明Transformer模型确实具有这一特性,但这些结果依赖于它们的注意力机制。因此,这些发现不适用于完全循环架构,如RNN、LSTM以及日益流行的SSM。我们证明RNN、LSTM、GRU、线性RNN以及线性门控架构(如Mamba和Hawk/Griffin)也可以作为通用上下文近似器。为了简化论证,我们引入了一种名为LSRL的编程语言,它可以编译到这些完全循环架构。LSRL可能对完全循环模型的进一步研究(例如构建可解释性基准)具有独立意义。我们还研究了乘法门控的作用,并观察到采用这种门控的架构(例如LSTM、GRU、Hawk/Griffin)可以更稳定地实现某些操作,使其成为实际上下文通用近似中更可行的候选者。

关键词

引用

@article{arxiv.2406.01424,
  title  = {Universal In-Context Approximation By Prompting Fully Recurrent Models},
  author = {Aleksandar Petrov and Tom A. Lamb and Alasdair Paren and Philip H. S. Torr and Adel Bibi},
  journal= {arXiv preprint arXiv:2406.01424},
  year   = {2024}
}

备注

Published at NeurIPS 2024, Code at https://github.com/AleksandarPetrov/LSRL