基于平滑深度度量学习的大规模问题复述检索
计算与语言
2019-05-31 v1 人工智能
信息检索
机器学习
摘要
问题复述检索(QPR)系统的目标是检索出与原始问题得到相同答案的等价问题。此类系统可通过将罕见且含噪的常见问题改写映射到一组规范形式,来理解和回答这些问题。这在社区问答(cQA)与开放域口语问答系统中有大规模应用。在本文中,我们描述了一种新的 QPR 系统,其实现为神经信息检索(NIR)系统,由神经网络句子编码器与用于高效向量检索的近似 k-近邻索引组成。我们还描述了通过远程监督从问答日志中自动生成用于问题复述检索实验的标注数据集的机制。我们展示了 NIR 中的标准损失函数——三元组损失——在含噪标签下表现不佳。我们提出平滑深度度量损失(SDML),并在两个 QPR 数据集上的实验表明,在含噪标签设定下其显著优于三元组损失。
引用
@article{arxiv.1905.12786,
title = {Large Scale Question Paraphrase Retrieval with Smoothed Deep Metric Learning},
author = {Daniele Bonadiman and Anjishnu Kumar and Arpit Mittal},
journal= {arXiv preprint arXiv:1905.12786},
year = {2019}
}