面向问答中 top-k 文档检索的增强向量
信息检索
2022-10-20 v1 计算与语言
机器学习
摘要
现代应用,尤其是以“搜索”为用例的信息检索 Web 应用,正逐步转向“回答”模块。已被证明对用户更具吸引力的对话式聊天机器人,以问答为核心。由于精确回答计算代价高昂,已开发若干方法以从数据库中预取含答案的最相关文档/段落。我们提出一种不同方法,高效且准确地检索证据文档,确保给定用户查询的相关文档不被遗漏。为此,我们为每个文档(或本例中为段落)分配唯一标识符,并用其创建可高效索引的稠密向量。更确切地说,我们使用该标识符来预测对应段落的相关问题的随机采样上下文窗口词,以及段落自身的词。这自然将段落标识符嵌入向量空间,使嵌入在不损害信息内容的前提下更靠近问题。该方法能够在约 4 毫秒内高效创建实时查询向量。
引用
@article{arxiv.2210.10584,
title = {Enhanced vectors for top-k document retrieval in Question Answering},
author = {Mohammed Hammad},
journal= {arXiv preprint arXiv:2210.10584},
year = {2022}
}
备注
Year-2019