中文

GAIA Search:面向 NLP 训练数据探索的 Hugging Face 与 Pyserini 互操作

计算与语言 2023-06-05 v1

摘要

注意到现代 NLP 领域亟需提供用于大规模文本语料库快速且用户友好的定性分析工具,我们提议转向信息检索(IR)领域成熟且经过充分验证的方法——该研究领域在应对 TB 级文档集合方面有着悠久历史。我们讨论了广泛使用的可复现 IR 研究工具包 Pyserini 如何与开源 AI 库及制品的 Hugging Face 生态系统集成。我们利用两个平台的现有功能,同时提出进一步促进其集成的新特性。我们的目标是为 NLP 研究者提供工具,使其能轻松且敏捷地开发基于检索的数据分析手段。我们包含了一个基于 Jupyter Notebook 的核心互操作特性演示,可在 GitHub https://github.com/huggingface/gaia 获取。随后我们展示了所提思想如何落地,以创建强大的 NLP 定性数据分析工具。我们提出 GAIA Search——一个遵循前述原则构建的搜索引擎,提供对四个流行大规模文本集合的访问。GAIA 具有双重目的:既阐明我们所讨论方法的潜力,也作为独立的定性分析工具,可供旨在训练前理解数据集的 NLP 研究者使用。GAIA 实时托管于 Hugging Face Spaces——https://huggingface.co/spaces/spacerini/gaia。

关键词

引用

@article{arxiv.2306.01481,
  title  = {GAIA Search: Hugging Face and Pyserini Interoperability for NLP Training Data Exploration},
  author = {Aleksandra Piktus and Odunayo Ogundepo and Christopher Akiki and Akintunde Oladipo and Xinyu Zhang and Hailey Schoelkopf and Stella Biderman and Martin Potthast and Jimmy Lin},
  journal= {arXiv preprint arXiv:2306.01481},
  year   = {2023}
}