基于动态测试集评估混合检索增强生成:LiveRAG 挑战
计算与语言
2025-07-01 v1 信息检索
摘要
我们呈现我们提交给 LiveRAG 挑战 2025 的方案,该挑战在使用 FineWeb-10BT 语料库对检索增强生成(RAG)系统进行动态测试集评估。我们的最终混合方法结合稀疏(BM25)和稠密(E5)检索方法,然后旨在使用 Falcon3-10B-Instruct 生成相关且可信的答案。通过在 200 个由 DataMorgana 生成的合成问题上进行系统评估(跨 64 个独特问题-用户组合),我们展示了使用 RankLLaMA 进行神经重排序可将 MAP 从 0.523 提升至 0.797(52% 相对提升),但引入了不可接受的计算成本(84 秒 vs 1.74 秒/问题)。尽管 DSPy 优化的提示策略实现了更高的语义相似度(0.771 vs 0.668),但其 0% 拒绝率引发了对过度自信和可塑性的担忧。我们提交的混合系统(无重排序)在 25 支队伍中在忠实度上位列第 4,在正确性上位列第 11。跨问题类别的分析揭示,问题与文档之间的词汇对齐是我们开发集上表现的最强预测器,文档相似表述的表述方式可将余弦相似度从 0.562 提升至 0.762。
引用
@article{arxiv.2506.22644,
title = {Evaluating Hybrid Retrieval Augmented Generation using Dynamic Test Sets: LiveRAG Challenge},
author = {Chase Fensore and Kaustubh Dhole and Joyce C Ho and Eugene Agichtein},
journal= {arXiv preprint arXiv:2506.22644},
year = {2025}
}
备注
4 pages, 3 tables, 2 figures. Accepted at the SIGIR LiveRAG Workshop 2025 (Submission 2664)