中文

SparseCL:面向矛盾检索的稀疏对比学习

计算与语言 2024-06-18 v1 信息检索

摘要

矛盾检索指的是识别并提取与查询内容明确相悖或反驳的文档,这对于事实核查和数据清洗等许多下游应用至关重要。为了从大型文档语料库中检索与查询相矛盾的论点,现有方法如相似性搜索和交叉编码器模型表现出显著的局限性。前者由于倾向于相似性的固有特性而难以捕捉矛盾的本质,而后者则存在计算效率低下的问题,尤其是在语料库规模较大时。为了应对这些挑战,我们引入了一种新颖的方法:SparseCL,它利用经过专门训练的句子嵌入来保留句子之间微妙的、矛盾的细微差别。我们的方法利用余弦相似度和稀疏函数的组合度量来高效地识别和检索与给定查询相矛盾的文档。这种方法通过将详尽的文档比较简化为简单的向量计算,极大地提高了矛盾检测的速度。我们使用 Arguana 数据集(一个专门针对矛盾检索的基准数据集)以及使用 GPT-4 从 MSMARCO 和 HotpotQA 数据集生成的合成矛盾数据来验证我们的模型。我们的实验证明了我们的方法不仅在矛盾检索方面的有效性——在不同模型架构上,在 MSMARCO 和 HotpotQA 上实现了超过 30% 的准确率提升——而且在诸如清理损坏的语料库以恢复高质量问答检索等应用中也同样有效。本文为提高大规模文本语料库中矛盾检索的准确性和效率指明了一个有前景的方向。

关键词

引用

@article{arxiv.2406.10746,
  title  = {SparseCL: Sparse Contrastive Learning for Contradiction Retrieval},
  author = {Haike Xu and Zongyu Lin and Yizhou Sun and Kai-Wei Chang and Piotr Indyk},
  journal= {arXiv preprint arXiv:2406.10746},
  year   = {2024}
}