用于文本序列匹配的多级注意力精炼协同堆叠残差亲和网络
计算与语言
2018-10-09 v1 人工智能
信息检索
摘要
学习两个文本序列间的匹配函数是 NLP 研究中长期存在的问题。该任务支撑诸多潜在应用,如问答与释义识别。本文提出协同堆叠残差亲和网络(CSRAN),一种针对该问题的全新通用神经架构。CSRAN 是一种深度架构,包含堆叠(多层)循环编码器。由于特征传播困难与梯度消失等固有弱点,堆叠/深度架构传统上难以训练。CSRAN 引入两个新颖组件以利用堆叠架构优势。首先,它提出一种新的双向对齐机制,通过跨堆叠层次融合序列对来学习亲和权重。其次,它在堆叠循环层之间利用多级注意力精炼组件。关键直觉在于,通过利用所有网络层次的信息,我们不仅能改善梯度流,还能提升整体性能。我们在六个被广泛研究的文本序列匹配数据集上开展充分实验,在所有数据集上均取得最先进性能。
引用
@article{arxiv.1810.02938,
title = {Co-Stack Residual Affinity Networks with Multi-level Attention Refinement for Matching Text Sequences},
author = {Yi Tay and Luu Anh Tuan and Siu Cheung Hui},
journal= {arXiv preprint arXiv:1810.02938},
year = {2018}
}
备注
EMNLP 2018