使用旅游数据的大规模问答
计算与语言
2020-04-28 v2 人工智能
信息检索
摘要
我们引入了利用描述候选答案实体的评论集合来回答寻求实体的推荐问题的新任务。我们收集了一个 QA 数据集,其中包含来自旅行者寻求酒店、景点和餐厅推荐的 47,124 个段落级真实用户问题。每个问题可从上千个候选答案中选择,且每个候选都关联一组非结构化评论。该数据集尤其具有挑战性,因为常用的用于推理和 QA 的神经架构在此规模任务上成本高得令人望而却步。作为解决方案,我们设计了一种可扩展的聚类-选择-重排序方法。它首先对每个实体的文本进行聚类以识别描述该实体的代表性句子,然后使用可扩展的神经信息检索(IR)模块从大型候选集中选择一组潜在实体。重排序器使用基于更深注意力架构从所选实体中挑选最佳答案。该策略优于纯 IR 或纯基于注意力的推理方法,在 Accuracy@3 上相对两者均带来近 25% 的提升。
引用
@article{arxiv.1909.03527,
title = {Large Scale Question Answering using Tourism Data},
author = {Danish Contractor and Krunal Shah and Aditi Partap and Mausam and Parag Singla},
journal= {arXiv preprint arXiv:1909.03527},
year = {2020}
}
备注
20 pages with supplementary notes