用于归纳式世界状态表示的更新器-提取器架构
计算与语言
2021-04-13 v1 人工智能
机器学习
摘要
开发 NLP 模型传统上包含两个阶段——训练与应用。训练后(在应用阶段)所获取信息的保留,在架构上受限于模型上下文窗口的大小(对于 transformer 而言),或受限于与长序列相关的实际困难(对于 RNN 而言)。在本文中,我们提出一种新颖的基于 transformer 的更新器-提取器(Updater-Extractor)架构及一种训练流程,其可处理任意长度的序列并基于语言输入精炼其关于世界的知识。我们显式地训练模型将传入信息整合进其世界状态表示中,从而获得强大的归纳泛化能力以及处理极长程依赖的能力。我们证明了一个引理,为我们的方法提供理论基础。该结果也揭示了使用截断时间反向传播(Truncated Back-Propagation Through Time)变体(如 Transformer XL)训练的模型的成功与失败模式。在实验上,我们在三项不同任务上考察了模型性能,展示了其潜力。本预印本仍在进行中。目前,我们聚焦于易于解释的任务,将所提思想应用于实际 NLP 应用留待未来。
引用
@article{arxiv.2104.05500,
title = {Updater-Extractor Architecture for Inductive World State Representations},
author = {Arseny Moskvichev and James A. Liu},
journal= {arXiv preprint arXiv:2104.05500},
year = {2021}
}
备注
15 pages (12 main content, 3 references and appendix), 4 figures