Match-Ignition:将 PageRank 植入 Transformer 用于长文本匹配
计算与语言
2021-08-18 v2 信息检索
摘要
神经文本匹配模型已广泛应用于社区问答、信息检索与对话。然而,这些为短文本设计的模型不能很好地解决长文本匹配问题,因为长文本中存在许多无法直接相互对齐的上下文,且现有模型难以从此类噪声数据中捕获关键匹配信号。此外,这些模型不加区分地使用全部文本数据,计算代价高昂。为应对有效性与效率问题,我们提出一种新颖的分层噪声过滤模型,即 Match-Ignition。其核心思想是将著名的 PageRank 算法植入 Transformer,以在匹配过程中识别并过滤句子级与词级噪声信息。噪声句子通常易于检测,因为已有工作表明其相似度可通过词重叠显式评估,故我们直接基于句子相似度图使用 PageRank 过滤此类信息。与句子不同,词依赖上下文表达具体含义,因此我们提出联合学习过滤与匹配过程,以良好捕获关键的词级匹配信号。具体而言,首先基于 Transformer 各自注意力块中的注意力分数构建词图,随后在该图上应用 PageRank 选取关键词。如此,噪声词将在匹配过程中被逐层过滤。实验结果表明,Match-Ignition 优于 SOTA 短文本匹配模型与近期长文本匹配模型。我们还做了详细分析,表明 Match-Ignition 高效捕获重要句子与词,从而促进长文本匹配过程。
引用
@article{arxiv.2101.06423,
title = {Match-Ignition: Plugging PageRank into Transformer for Long-form Text Matching},
author = {Liang Pang and Yanyan Lan and Xueqi Cheng},
journal= {arXiv preprint arXiv:2101.06423},
year = {2021}
}
备注
Accepted as long paper by CIKM 2021