具有改进负对比的神经段落检索
计算与语言
2020-10-26 v1
摘要
在本文中,我们探讨了用于自动问答中段落检索的双编码器模型里负采样的影响。我们探索了四种对通常用来训练双编码器模型的简单随机负采样起到补充作用的负采样策略。在这四种策略中,三种基于检索,一种基于启发式方法。我们基于检索的策略依赖于问题与段落之间的语义相似度和词法重叠。我们分两个阶段训练双编码器模型:使用合成数据进行预训练,以及使用领域特定数据进行微调。我们将负采样应用于这两个阶段。该方法在两个段落检索任务上进行了评估。尽管并不明显存在一种在所有任务中都表现最佳的单一采样策略,但我们的策略显然有助于改善应答段落与所有其他段落之间的对比。此外,混合来自不同策略的负样本在所有任务中取得了与最佳表现策略相当的性能。我们的结果在所评估的两个开放域问答数据集上确立了新的SOTA性能水平。
引用
@article{arxiv.2010.12523,
title = {Neural Passage Retrieval with Improved Negative Contrast},
author = {Jing Lu and Gustavo Hernandez Abrego and Ji Ma and Jianmo Ni and Yinfei Yang},
journal= {arXiv preprint arXiv:2010.12523},
year = {2020}
}