AILS-NTUA 在 SemEval-2026 任务 8 中的参赛方案:评估多轮检索增强生成对话
计算与语言
2026-03-12 v1
摘要
我们呈现 AILS-NTUA 系统用于 SemEval-2026 任务 8(MTRAGEval),涵盖多轮检索增强生成的三个子任务: passages 检索 (A)、参考依据驱动的响应生成 (B) 以及端到端 RAG (C)。我们的统一架构基于两个原则:(i) 查询多样性-检索器多样性策略,针对单个语料对齐的稀疏检索器发出五个互补的基于 LLM 的查询改写版本,并通过方差感知的嵌套 Reciprocal Rank Fusion 进行融合;(ii) 多阶段生成管道,将依据生成分解为证据片段抽取、双候选草案生成和校准的多裁判选择。该系统在任务 A 中名列第 1 位(nDCG@5: 0.5776,超越最强基线提升 20.5%),在任务 B 中名列第 2 位(HM: 0.7698)。经验分析表明,针对已对齐检索器的查询多样性优于异构检索器集成,而答案可行性校准——而非检索覆盖率——是端到端性能的主要瓶颈。
引用
@article{arxiv.2603.10524,
title = {AILS-NTUA at SemEval-2026 Task 8: Evaluating Multi-Turn RAG Conversations},
author = {Dimosthenis Athanasiou and Maria Lymperaiou and Giorgos Filandrianos and Athanasios Voulodimos and Giorgos Stamou},
journal= {arXiv preprint arXiv:2603.10524},
year = {2026}
}