QUADRo:问答数据库检索的数据集与模型
计算与语言
2023-04-04 v1 机器学习
摘要
构建自动问答系统的一种有效范式是复用先前已回答的问题,例如用于常见问题解答或论坛应用。给定一个问答(q/a)对数据库(DB),可以通过扫描 DB 寻找相似问题来回答目标问题。在本文中,我们将该方法扩展到开放领域,使其与其他标准方法(如非结构化文档或基于图的方法)具有竞争力。为此,我们 (i) 利用公开问题构建了包含 630 万 q/a 对的大规模 DB,(ii) 设计了基于神经 IR 和 q/a 对重排序器的新型系统,以及 (iii) 构建了训练和测试数据以使用我们的模型进行对比实验。我们证明了使用 (q,a) 对的基于 Transformer 的模型在神经搜索和重排序方面均优于仅基于问题表示的模型。此外,我们展示了我们基于 DB 的方法与基于 Web 的方法(即构建在 BING 搜索引擎之上的 QA 系统)具有竞争力,展示了寻找相关信息的挑战。最后,我们公开了数据和模型以供未来研究。
引用
@article{arxiv.2304.01003,
title = {QUADRo: Dataset and Models for QUestion-Answer Database Retrieval},
author = {Stefano Campese and Ivano Lauriola and Alessandro Moschitti},
journal= {arXiv preprint arXiv:2304.01003},
year = {2023}
}