中文

为第一阶段排序构建集合组合与否定表示

信息检索 2025-01-15 v1

摘要

集合组合和否定查询对于表达复杂的信息需求至关重要,并能够发现诸如关于非欧洲君主的书籍等小众项目。尽管 LLM 最近取得了进展,但由于需要独立于彼此对文档和查询进行编码,第一阶段排序仍然具有挑战性。这一局限性要求构建包含逻辑运算或否定、并可用于有效匹配相关文档的组合查询表示。在本工作的第一部分,我们探索在零样本设置下,利用词法基础的习得稀疏检索表示之间的向量运算来构建此类表示。具体而言,我们引入了仅惩罚查询中否定部分的解耦否定,以及增强 LSR 处理交集能力的组合伪词方法。我们发现我们的零样本方法具有竞争力,并且通常优于在组合数据上微调的检索器,突出了 LSR 和密集检索器的某些局限性。最后,我们解决了其中一些局限性,通过允许 LSR 归因负词项分数并有效惩罚包含否定词项的文档,提高了 LSR 在否定方面的表示能力。

关键词

引用

@article{arxiv.2501.07679,
  title  = {Constructing Set-Compositional and Negated Representations for First-Stage Ranking},
  author = {Antonios Minas Krasakis and Andrew Yates and Evangelos Kanoulas},
  journal= {arXiv preprint arXiv:2501.07679},
  year   = {2025}
}

备注

12 pages