通过显式关系编码增强 Transformer 以解决数学问题
机器学习
2020-11-05 v2 机器学习
摘要
我们将张量积表示(Tensor-Product Representations)融入 Transformer,以更好地支持关系结构的显式表示。我们的张量积 Transformer(TP-Transformer)在近期引入的包含 56 类自由形式数学应用题的数学数据集(Mathematics Dataset)上确立了新的 SOTA。该模型的核心组件是一种新颖的注意力机制,称为 TP-Attention,它显式编码每个 Transformer 单元与通过注意力检索到值的其他单元之间的关系。TP-Attention 超越检索值的线性组合,强化表示构建并解决由多层标准注意力引入的歧义。TP-Transformer 的注意力图更好地揭示了它如何解决数学数据集中的挑战性问题。预训练模型与代码将在发表后公开。
引用
@article{arxiv.1910.06611,
title = {Enhancing the Transformer with Explicit Relational Encoding for Math Problem Solving},
author = {Imanol Schlag and Paul Smolensky and Roland Fernandez and Nebojsa Jojic and Jürgen Schmidhuber and Jianfeng Gao},
journal= {arXiv preprint arXiv:1910.06611},
year = {2020}
}