通过词项集生成实现生成式检索
信息检索
2024-04-16 v3
摘要
近来,生成式检索作为传统检索范式的一种有前景的替代方案而出现。它为每篇文档分配一个唯一标识符(称为DocID),并采用生成模型直接为输入查询生成相关的DocID。DocID的常见选择是一个或多个自然语言序列,例如标题或n-gram,从而可利用生成模型的预训练知识。然而,序列是逐词元(token)生成的,在每个解码步仅保留最可能候选而剪枝其余,因此若相关DocID中任一词元被错误剪枝,检索即失败。更糟的是,解码过程中模型只能感知DocID中前面的词元而无法看见后续词元,因而容易犯此类错误。为解决该问题,我们提出一种称为词项集生成(TSGen)的新型生成式检索框架。我们使用一组词项而非序列作为DocID,这些词项自动选取以简洁概括文档语义并区别于其他文档。基于词项集DocID,我们提出一种排列不变的解码算法,词项集可以任意排列生成却总能对应到相应文档。值得注意的是,TSGen在每个解码步感知所有有效词项而非仅前面的词元。在恒定解码空间下,其因更广阔的视角可做出更可靠的决策。TSGen对错误也具有韧性:只要解码出的词项属于相关DocID,就不会被剪枝。最后,我们设计了一种迭代优化过程,以激励模型以其偏好的排列生成相关词项集。我们在流行基准上进行了大量实验,验证了TSGen的有效性、泛化性、可扩展性与效率。
引用
@article{arxiv.2305.13859,
title = {Generative Retrieval via Term Set Generation},
author = {Peitian Zhang and Zheng Liu and Yujia Zhou and Zhicheng Dou and Fangchao Liu and Zhao Cao},
journal= {arXiv preprint arXiv:2305.13859},
year = {2024}
}