Caraman参加SemEval-2026 Task 8:基于查询重写、混合检索和交叉编码重排序的三阶段多轮检索
计算与语言
2026-05-13 v1 信息检索
摘要
我们描述了用于SemEval-2026 Task 8 (MTRAGEval)的系统,参赛于四个英文语言领域的任务A(检索)。我们的方法采用三阶段流水线:(1) 通过LoRA微调的Qwen 2.5 7B模型进行查询重写,将依赖上下文的后续问题转化为独立查询;(2) 通过Reciprocal Rank Fusion组合BM25和稠密检索;(3) 使用BGE-reranker-v2-m3进行交叉编码重排序。在官方测试集上,该系统实现了nDCG@5为0.531,排名38支参赛队中的第8名,超过组织者基线10.7%。开发比较表明,针对查询生成的领域特定温度调控——其中技术领域受益于确定性解码,一般领域受益于受控随机性——可提供持续的提升,而更复杂的策略如领域感知提示和多查询扩展反而会降低性能。
引用
@article{arxiv.2605.12028,
title = {Caraman at SemEval-2026 Task 8: Three-Stage Multi-Turn Retrieval with Query Rewriting, Hybrid Search, and Cross-Encoder Reranking},
author = {David-Maximilian Caraman and Gheorghe Cosmin Silaghi},
journal= {arXiv preprint arXiv:2605.12028},
year = {2026}
}
备注
Accepted at SemEval2026, task 8: MTRAGEval