变压器在何种情况下才能进行原子化零样本推理?
机器学习
2024-07-18 v1 神经与进化计算
摘要
许多任务可以从少量独立组件中组合而成。这导致可能在训练期间仅遇到其中一些任务的组合爆炸。变压器在什么情况下才能从一部分任务组合推广到所有共享类似组件的任务组合?在本文中,我们研究了一个模块化多任务设置,允许我们精确控制数据生成过程中的原子化结构。我们提供的证据表明,尽管变压器在原则上足以进行这种原子化推理,但在该任务上进行的原子化学习仍然困难。只有在引入瓶颈以强制执行任务推断与任务执行之间的显式分离后,才可能实现原子化推理。
引用
@article{arxiv.2407.12275,
title = {When can transformers compositionally generalize in-context?},
author = {Seijin Kobayashi and Simon Schug and Yassir Akram and Florian Redhardt and Johannes von Oswald and Razvan Pascanu and Guillaume Lajoie and João Sacramento},
journal= {arXiv preprint arXiv:2407.12275},
year = {2024}
}
备注
ICML 2024 workshop on Next Generation of Sequence Modeling Architectures