中文

ChunkNorris:面向 PDF 解析与分块的高性能低能耗方法

信息检索 2026-02-03 v1 人工智能 计算与语言

摘要

在检索增强生成(RAG)应用中,信息检索环节至关重要,因为它提供了上下文信息,使大型语言模型能够生成恰当且真实的响应。高质量的解析与分块至关重要,因为高效的数据分段直接影响下游任务,即信息检索和答案生成。本文介绍了 ChunkNorris,一种 novel 的基于启发式的技术,旨在优化 PDF 文档的解析与分块。我们的做法不依赖机器学习,采用一套简单而有效的启发式方法,以最小的计算开销实现高性能。我们通过对现有解析与分块方法进行全面基准测试,评估了执行时间、能源消耗和检索准确性等指标,展示了 ChunkNorris 的效率。我们提出了一个开放访问的数据集以产生我们的结果。ChunkNorris 在基线和更先进的技术上均表现出色,为信息检索任务提供了实用且高效的替代方案。因此,这项研究凸显了基于启发式方法在现实世界、资源受限的 RAG 应用中的潜力。

关键词

引用

@article{arxiv.2602.00010,
  title  = {ChunkNorris: A High-Performance and Low-Energy Approach to PDF Parsing and Chunking},
  author = {Mathieu Ciancone and Clovis Varangot-Reille and Marion Schaeffer},
  journal= {arXiv preprint arXiv:2602.00010},
  year   = {2026}
}