Rankify:一个用于检索、重排序和检索增强生成的综合 Python 工具包
信息检索
2025-02-21 v3 计算与语言
摘要
检索、重排序和检索增强生成(RAG)是信息检索、问答或基于知识的文本生成等现代应用中的关键组成部分。然而,现有解决方案往往是碎片化的,缺乏一个能够轻松集成这些基本流程的统一框架。标准化实现的缺失,加上检索和重排序工作流的复杂性,使得研究人员难以在一致的环境中比较和评估不同的方法。尽管现有的工具包如 Rerankers 和 RankLLM 提供了通用的重排序流水线,但它们通常缺乏进行细粒度实验和基准测试所需的灵活性。为了应对这些挑战,我们推出了 Rankify,这是一个功能强大且模块化的开源工具包,旨在将检索、重排序和 RAG 统一在一个内聚的框架内。Rankify 支持广泛的检索技术,包括稠密和稀疏检索器,同时整合了最先进的重排序模型以提高检索质量。此外,Rankify 包含一组预检索数据集以方便基准测试,可在 Huggingface (https://huggingface.co/datasets/abdoelsayed/reranking-datasets-light) 获取。为了鼓励采用和简化集成,我们提供了全面的文档 (http://rankify.readthedocs.io/)、GitHub 上的开源实现 (https://github.com/DataScienceUIBK/rankify) 以及便于安装的 PyPI 包 (https://pypi.org/project/rankify/)。作为一个统一且轻量级的框架,Rankify 使研究人员和从业者能够推进检索和重排序方法,同时确保一致性、可扩展性和易用性。
引用
@article{arxiv.2502.02464,
title = {Rankify: A Comprehensive Python Toolkit for Retrieval, Re-Ranking, and Retrieval-Augmented Generation},
author = {Abdelrahman Abdallah and Bhawna Piryani and Jamshid Mozafari and Mohammed Ali and Adam Jatowt},
journal= {arXiv preprint arXiv:2502.02464},
year = {2025}
}
备注
Work in Progress