LogiPart: 用于大规模数据探索的本地大语言模型与逻辑分区
摘要
在大型文本语料库中发现深层、可引导的分类体系 currently 受限于主题模型的表面级效率与 LLM 集成框架的高昂、不可扩展的赋值成本之间的权衡。我们提出 \textbf{LogiPart},一个可扩展的、假设驱动的框架,用于构建可解释的分层分区,将层次增长与昂贵的全语料库 LLM 条件解耦。LogiPart 利用本地托管的 LLM 在紧凑的、嵌入感知的样本上生成简洁的自然语言分类学谓词。随后,这些谓词通过零样本自然语言推理(NLI)结合快速的基于图的标签传播在整个语料库上高效评估,实现相对于语料库规模的每节点常数 生成 token 复杂度。我们在四个不同的文本语料库(总计约 140,000 份文档)上评估 LogiPart。通过结构化流形进行 \textbf{校准},我们识别出在 14B 参数规模下实现稳定语义锚定所需的经验推理阈值。在复杂、高熵语料库(Wikipedia、US Bills)上,传统主题指标揭示出``对齐差距'',而逆向逻辑验证确认了所诱导逻辑的稳定性,单个分类学二分法的每节点路由准确率高达 96\%。独立 LLM-as-a-judge 的定性审核确认了有意义的功能轴(如政策意图)的发现,而这些是主题真实标签无法捕捉的。LogiPart 使前沿级探索性分析能够在消费级硬件上进行,使得在现实计算和治理约束下假设驱动的分类学发现成为可能。
引用
@article{arxiv.2509.22211,
title = {LogiPart: Local Large Language Models for Data Exploration at Scale with Logical Partitioning},
author = {Tiago Fernandes Tavares},
journal= {arXiv preprint arXiv:2509.22211},
year = {2026}
}
备注
This version introduces a major architectural shift to Local LLMs and NLI-based assignment, scaling the framework to O(1) generative complexity. Formerly titled 'Question-Driven Analysis and Synthesis'