Transformer 何时能基于抽象符号进行推理?
计算与语言
2024-04-17 v2 人工智能
机器学习
摘要
我们研究 transformer 模型在关系推理任务上的能力。在这些任务中,模型在一组编码抽象关系的字符串上训练,随后在包含训练集中未出现符号的数据上进行分布外测试。我们证明,对于一大类任务中的任意关系推理任务,当通过梯度下降在足够大量的训练数据上训练时,transformer 能学习抽象关系并泛化到测试集。这与经典的完全连接网络形成对比,我们证明后者无法学会推理。我们的结果启发了对 transformer 架构的改进,每个注意力头仅增加两个可训练参数,并且我们通过实验证明这些改进提升了学习推理的数据效率。
引用
@article{arxiv.2310.09753,
title = {When can transformers reason with abstract symbols?},
author = {Enric Boix-Adsera and Omid Saremi and Emmanuel Abbe and Samy Bengio and Etai Littwin and Joshua Susskind},
journal= {arXiv preprint arXiv:2310.09753},
year = {2024}
}
备注
25 figures