冻结的预训练语言模型能否用于实体中心问题的零样本神经检索?
计算与语言
2023-03-10 v1 人工智能
摘要
神经文档检索器,包括稠密段落检索(DPR),在特定问答数据集上微调与测试时已超越 BM25 等经典词汇匹配检索器。然而,已有研究表明,现有稠密检索器不仅跨域泛化能力差,即便在如维基百科等域内也同样表现不佳,尤其当问题中的命名实体是检索的主导线索时。本文中,我们提出一种利用域内实体训练的冻结语言模型所生成嵌入来实现域内泛化的方法。通过不微调,我们探索预训练语言模型所含丰富知识可用于检索任务的可能性。所提方法在维基百科域实体中心问题上优于传统 DPR,并达到与 BM25 及最先进 SPAR 模型几乎相当的性能。我们还表明,当实体名称由常见词构成时,上下文键相较于 BM25 带来显著提升。我们的结果证明了针对维基百科域实体中心问题的零样本检索方法的可行性,而 DPR 在该场景下难以奏效。
引用
@article{arxiv.2303.05153,
title = {Can a Frozen Pretrained Language Model be used for Zero-shot Neural Retrieval on Entity-centric Questions?},
author = {Yasuto Hoshi and Daisuke Miyashita and Yasuhiro Morioka and Youyang Ng and Osamu Torii and Jun Deguchi},
journal= {arXiv preprint arXiv:2303.05153},
year = {2023}
}
备注
Accepted to Workshop on Knowledge Augmented Methods for Natural Language Processing, in conjunction with AAAI 2023