Transformer何时能够接地与组合:来自组合泛化基准的洞察
计算与语言
2022-11-01 v2
摘要
人类能够进行组合推理,同时将语言表述接地到真实世界。近期的基准如ReaSCAN使用接地于网格世界的导航任务来评估神经模型是否展现出类似能力。在本工作中,我们提出了一个简单的基于Transformer的模型,其在ReaSCAN和修改后的gSCAN上优于专用架构。在分析该任务时,我们发现识别网格世界中的目标位置是模型的主要挑战。此外,我们表明ReaSCAN中测试深度泛化的一个特定划分是不公平的。在该划分的修正版本上,我们展示Transformer能够泛化到更深的输入结构。最后,我们设计了一个更简单的接地组合泛化任务RefEx,以研究Transformer如何进行组合推理。我们展示了一个具有单个头的单一自注意力层能够泛化到物体属性的新颖组合。此外,我们从学习到的网络中推导出了Transformer计算的精确数学构造。总体而言,我们提供了关于接地组合泛化任务及Transformer在该任务上行为的宝贵洞察,这将对从事该领域研究的研究人员有所助益。
引用
@article{arxiv.2210.12786,
title = {When Can Transformers Ground and Compose: Insights from Compositional Generalization Benchmarks},
author = {Ankur Sikarwar and Arkil Patel and Navin Goyal},
journal= {arXiv preprint arXiv:2210.12786},
year = {2022}
}
备注
EMNLP 2022