具有前瞻注意力的自回归建模
计算与语言
2023-05-23 v1 人工智能
机器学习
摘要
为了预测下一个词元,自回归模型通常只考察过去。它们是否也能从考察假设的未来中获益?我们考虑一种基于 Transformer 的新型自回归架构,它根据某个提议分布对过去进行多种续写的外推,并对这些扩展后的字符串进行注意力计算,从而估计下一个词元的分布。该架构从诸如棋盘游戏玩家等经典 AI 系统中获得启示:当做出局部决策时,策略可能受益于探索可能的未来轨迹并进行分析。在包括形态屈折和布尔可满足性在内的多个任务上,我们的前瞻模型能够胜过规模相当的普通 Transformer 模型。然而,在某些任务上,它似乎受益于额外的计算,而并未真正使用前瞻信息。我们讨论了可能的变体架构以及未来的加速方法。
引用
@article{arxiv.2305.12272,
title = {Autoregressive Modeling with Lookahead Attention},
author = {Li Du and Hongyuan Mei and Jason Eisner},
journal= {arXiv preprint arXiv:2305.12272},
year = {2023}
}