中文

RankArena:用于人类和 LLM 反馈的统一检索、重排序和 RAG 评估平台

信息检索 2025-08-08 v1

摘要

评估检索增强生成(RAG)和文档重排序系统的质量,由于缺乏可扩展、以用户为中心且多视角的评估工具而面临挑战。我们引入 RankArena,一个统一平台,用于使用结构化的人类和 LLM 反馈比较和分析检索管道、重排序器和 RAG 系统的性能,并用于收集此类反馈。RankArena 支持多种评估模式:直接重排序可视化、盲法成对比较(人类或 LLM 投票)、受监督的手动文档标注以及端到端 RAG 回答质量评估。它通过人类和 LLM 的成对偏好以及完整列表标注捕获细粒度相关性反馈,同时收集辅助元数据,如位移指标、标注时间和质量评分。该平台还集成了 LLM-as-a-judge 评估,实现模型生成的排序与人类基准注释之间的比较。所有交互均以结构化评估数据集形式存储,可用于训练重排序器、奖励模型、判断智能体或检索策略选择器。该平台已公开提供,网址为 https://rankarena.ngrok.io/,并提供演示视频 https://youtu.be/jIYAP4PaSSI。

关键词

引用

@article{arxiv.2508.05512,
  title  = {RankArena: A Unified Platform for Evaluating Retrieval, Reranking and RAG with Human and LLM Feedback},
  author = {Abdelrahman Abdallah and Mahmoud Abdalla and Bhawna Piryani and Jamshid Mozafari and Mohammed Ali and Adam Jatowt},
  journal= {arXiv preprint arXiv:2508.05512},
  year   = {2025}
}

备注

Accept at CIKM 2025