剪枝索引内容以实现内存高效的开放域问答
计算与语言
2021-04-13 v2 人工智能
机器学习
摘要
本工作提出一种新颖流水线,展示了结合最先进方法所能达成的成果。具体而言,其提出新颖的 R2-D2(Rank twice, reaD twice,即排序两次、读取两次)流水线,由检索器、段落重排器、抽取式阅读器、生成式阅读器及一种简单组合方式构成。此外,先前工作常伴随规模达数十 GiB 量级的外部文档庞大索引。本工作提出一种简单方法,用于剪枝庞大索引的内容,使得开放域 QA 系统连同索引、操作系统及库组件可装入 6GiB docker 镜像,同时仅保留原始索引内容的 8% 且仅损失 3% 的 EM 准确率。
引用
@article{arxiv.2102.10697,
title = {Pruning the Index Contents for Memory Efficient Open-Domain QA},
author = {Martin Fajcik and Martin Docekal and Karel Ondrej and Pavel Smrz},
journal= {arXiv preprint arXiv:2102.10697},
year = {2021}
}
备注
v2 - added connection between pruner and DPR, results on TriviaQA, new reranker, results with HN-DPR checkpoint and additional analyses