以递归组合多粒度表示增强Transformer
计算与语言
2024-03-13 v2 人工智能
摘要
我们提出ReCAT,一种递归组合增强的Transformer,能够在学习与推理阶段不依赖黄金句树的情况下显式建模原始文本的层次句法结构。现有此类研究限制数据遵循层次树结构,因而缺乏跨片段通信。为克服该问题,我们提出一种新颖的上下文内外(CIO)层,通过自底向上与自顶向下传递学习片段的上下文化表示:自底向上传递由组合低层片段形成高层片段表示,而自顶向下传递结合片段内外信息。通过在Transformer的嵌入层与注意力层之间堆叠若干CIO层,ReCAT模型可执行深度片段内与深度片段间交互,从而生成与其他片段完全上下文化的多粒度表示。此外,CIO层可与Transformer联合预训练,使ReCAT同时具备可扩展性、强性能与可解释性。我们在多种句子级与片段级任务上开展实验。评估结果表明,ReCAT在所有片段级任务上显著优于原始Transformer模型,在自然语言推理任务上优于将递归网络与Transformer结合的基线。更有趣的是,ReCAT诱导的层次结构与人工标注句法树表现出强一致性,表明CIO层带来了良好可解释性。
引用
@article{arxiv.2309.16319,
title = {Augmenting Transformers with Recursively Composed Multi-grained Representations},
author = {Xiang Hu and Qingyang Zhu and Kewei Tu and Wei Wu},
journal= {arXiv preprint arXiv:2309.16319},
year = {2024}
}
备注
ICLR 2024 poster