中文

简单实体中心问题挑战稠密检索器

计算与语言 2022-02-23 v3 信息检索

摘要

近期,由于稠密检索模型仅用少量监督训练样本便超越稀疏模型,开放域问答迅速走红。然而,本文中我们表明当前稠密模型尚非检索的圣杯。我们首先构建 EntityQuestions,一组基于 Wikidata 事实的简单、富含实体的问题(如“Arve Furset 生于何处?”),并观察到稠密检索器表现远逊于稀疏方法。我们调查此问题并揭示:除非问题模式在训练中被显式观察到,稠密检索器只能泛化至常见实体。我们讨论解决这一关键问题的两种简单方案。首先,我们证明数据增强无法修复该泛化问题。其次,我们认为更鲁棒的段落编码器有助于利用专门的问题编码器促成更好的问题适配。我们希望本工作能揭示创建在不同输入分布下均表现良好的鲁棒通用稠密检索器所面临的挑战。

关键词

引用

@article{arxiv.2109.08535,
  title  = {Simple Entity-Centric Questions Challenge Dense Retrievers},
  author = {Christopher Sciavolino and Zexuan Zhong and Jinhyuk Lee and Danqi Chen},
  journal= {arXiv preprint arXiv:2109.08535},
  year   = {2022}
}

备注

EMNLP 2021. The code and data is publicly available at https://github.com/princeton-nlp/EntityQuestions