用于非对称域文本匹配的 Wasserstein 距离正则化序列表示
计算与语言
2020-10-20 v2 信息检索
摘要
匹配来自非对称域的文本的一种方法是:将输入序列投影到一个公共语义空间中作为特征向量,在此基础上可便捷地定义并学习匹配函数。在实际匹配应用中常观察到,随着训练进行,来自不同域的投影特征向量趋于不可区分。然而这一现象在现有匹配模型中常被忽视。结果,特征向量在构建时没有任何正则化,这不可避免地增加了学习下游匹配函数的难度。本文提出一种专为非对称域文本匹配设计的新颖匹配方法,称为 WD-Match。在 WD-Match 中,定义了基于 Wasserstein 距离的正则化项来正则化来自不同域的投影特征向量。因此,该方法强制特征投影函数生成这样的向量:对应不同域的向量无法被轻易判别。WD-Match 的训练过程等价于一个由 Wasserstein 距离正则化匹配损失的博弈。WD-Match 可通过将其作为底层匹配模型来改进不同的文本匹配方法。文中利用了四种流行的文本匹配方法。基于四个公开可用基准的实验结果表明,WD-Match 一致地优于底层方法与基线。
引用
@article{arxiv.2010.07717,
title = {Wasserstein Distance Regularized Sequence Representation for Text Matching in Asymmetrical Domains},
author = {Weijie Yu and Chen Xu and Jun Xu and Liang Pang and Xiaopeng Gao and Xiaozhao Wang and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2010.07717},
year = {2020}
}
备注
accepted as long paper by EMNLP 2020