论LLM基稠密检索器的鲁棒性:面向通用性与稳定性的系统性分析
信息检索
2026-04-21 v1 计算与语言
摘要
解码器架构的大语言模型(LLM)正逐渐取代BERT等式架构作为稠密检索的底层模型,实现显著的性能提升并获得广泛采用。然而,LLM基稠密检索器的鲁棒性尚未得到充分探索。本文提出首个系统性研究LLM基稠密检索器的鲁棒性,从两个互补的角度进行:通用性与稳定性。针对通用性,我们在覆盖30个数据集的四个基准上评估检索有效性,使用线性混合效应模型估计边际平均性能,并分解固有模型能力与数据集异构性。我们的分析表明,虽然指令调优模型总体表现优异,但针对复杂推理优化的模型常常会出现“专业化税”,在更广泛的上下文中表现有限。针对稳定性,我们评估模型对意外查询变体(如改写、拼写错误)以及恶意对抗攻击(如语料污染)的韧性。我们发现,LLM基稠密检索器在抵抗拼写错误和语料污染方面优于仅编码器的基线模型,但在抵抗语义扰动(如同义词替换)时仍然脆弱。进一步分析表明,嵌入几何(如角度均匀性)可为词汇稳定性提供预测信号,并且模型规模通常会提高鲁棒性。这些发现为未来的鲁棒性感知检索器设计和原则化基准测试提供了指导。我们的代码已公开于https://github.com/liyongkang123/Robust_LLM_Retriever_Eval。
引用
@article{arxiv.2604.16576,
title = {On the Robustness of LLM-Based Dense Retrievers: A Systematic Analysis of Generalizability and Stability},
author = {Yongkang Li and Panagiotis Eustratiadis and Yixing Fan and Evangelos Kanoulas},
journal= {arXiv preprint arXiv:2604.16576},
year = {2026}
}