中文

PAQ:6500万个可能提出的问题及其用途

计算与语言 2021-02-16 v1 人工智能 机器学习

摘要

直接利用问答(QA)对的开放域问答模型,例如闭卷问答(CBQA)模型和QA对检索器,相较于从文本语料库中检索并阅读的常规模型,在速度和内存方面展现出优势。QA对检索器还提供可解释的回答、高度的可控性,并且能在测试时以新知识的琐碎方式更新。然而,这些模型缺乏检索-阅读系统的准确性,因为相对于像维基百科这样的文本语料库,可用QA对所覆盖的知识量大幅减少。为促进改进QA对模型,我们引入了可能提出的问题(PAQ),一个由6500万个自动生成的QA对组成的极大规模资源。我们引入了一种新的QA对检索器RePAQ,以补充PAQ。我们发现PAQ能预先拦截并缓存测试问题,使RePAQ在保持显著更快速度的同时,匹配近期检索-阅读模型的准确性。利用PAQ,我们训练的CBQA模型比可比基线高出5%,但落后RePAQ超过15%,表明显式检索的有效性。RePAQ可针对尺寸(低于500MB)或速度(每秒超过1K个问题)进行配置,同时保留高准确性。最后,我们展示了RePAQ在选择性问答上的优势,在其可能错误时放弃回答。这使得RePAQ能够“退避”到更昂贵的先进模型中,从而产生一个组合系统,其准确性更高且比单独使用先进模型快2倍。

关键词

引用

@article{arxiv.2102.07033,
  title  = {PAQ: 65 Million Probably-Asked Questions and What You Can Do With Them},
  author = {Patrick Lewis and Yuxiang Wu and Linqing Liu and Pasquale Minervini and Heinrich Küttler and Aleksandra Piktus and Pontus Stenetorp and Sebastian Riedel},
  journal= {arXiv preprint arXiv:2102.07033},
  year   = {2021}
}