中文

Quecto-V1:面向设备端法律检索的8位量化小型语言模型实证分析

计算与语言 2026-02-19 v1

摘要

大语言模型(LLM)的快速普及已彻底变革了自然语言处理(NLP),但同时也制造了“资源鸿沟”。典型的法律智能系统依赖巨大的参数规模(7B+)和基于云端的推理,导致在资源受限的环境中难以使用,同时存在显著的数据主权风险。本文介绍 Quecto-V1,一个面向印度法律智能的领域特定小型语言模型(Small Language Model, SLM),旨在 democratize(民主化)印度法律智能的访问。基于 GPT-2 架构的自定义配置(1.24 亿参数),Quecto-V1 仅在印度法律法规语料库上训练,包括《印度刑法》(IPC)、《刑事诉讼法》(CrPC)以及印度宪法。与通用模型不同,本方法最大化了法律领域的“词汇密度”。此外,我们通过应用后训练 8 位量化(GGUF 格式),将模型压缩至约 150 MB 的内存占用。我们的实证分析表明,Quecto-V1 在检索法律条文定义和罪名规定方面实现了高保真度, 在领域特定的精确匹配任务中超越了通用小型语言模型,能够在消费级 CPU 上完全离线运行。我们进一步 presented an ablation study 显示,8 位量化实现了约 74% 的模型大小减小,同时仅有小于 3.5% 的检索准确率下降。这些发现表明,对于像法律这样的专业、高风险领域,领域特定的训练结合激进的量化为单一的云端模型提供了可行的、隐私保护的替代方案。

关键词

引用

@article{arxiv.2602.16640,
  title  = {Quecto-V1: Empirical Analysis of 8-bit Quantized Small Language Models for On-Device Legal Retrieval},
  author = {Subrit Dikshit},
  journal= {arXiv preprint arXiv:2602.16640},
  year   = {2026}
}

备注

5 pages, 2 tables