中文

通过多正样本对比学习提高密集检索器对拼写错误的鲁棒性

信息检索 2024-03-19 v1

摘要

密集检索已成为 passage retrieval 的新范式。尽管在处理无拼写错误查询时效果出色,但在处理包含拼写错误的查询时鲁棒性较差。当前提高密集检索器拼写错误鲁棒性的方法通过(1)数据增强获取拼写错误查询以进行训练时间,以及(2)额外的鲁棒化子任务,以对齐原始无拼写错误查询与其拼写错误变体。尽管存在多个拼写错误变体作为每个查询的正样本,但一些方法假设每个锚点只有一个正样本和一组负样本,并以对比学习方式处理鲁棒化子任务;因此,在 insufficient use of the multiple positives(多个正样本)方面存在不足。相反,本文认为所有可用的正样本可以同时使用,并采用支持 multiple positives(多正样本)的对比学习。实验结果表明,我们的方法在鲁棒化子任务上同时利用所有正样本并采用多正样本对比学习,相比仅使用单个正样本的对比学习方法,在抗拼写错误鲁棒性方面具有显著优势。

关键词

引用

@article{arxiv.2403.10939,
  title  = {Improving the Robustness of Dense Retrievers Against Typos via Multi-Positive Contrastive Learning},
  author = {Georgios Sidiropoulos and Evangelos Kanoulas},
  journal= {arXiv preprint arXiv:2403.10939},
  year   = {2024}
}

备注

Accepted at the 46th European Conference on Information Retrieval (ECIR 2024)