中文

基于局部LLM的节约型知识图构建:零-shot管道、自一致性与人工群体的智慧

人工智能 2026-04-14 v1 信息检索 机器学习 神经与进化计算

摘要

本文提出一个经验研究,探讨在消费级硬件上完全通过本地推理执行的多模型零-shot管道,用于知识图构建与利用。我们提出一个可复现的评估框架,集成两个外部基准(DocRED、HotpotQA)、WebQuestionsSP风格的合成数据,以及RAGAS评估框架,形成自动化管道。在500个文档级关系上,我们的系统在零-shot条件下实现了0.70±0.041的F1分数,优于监督学习的DREEAM的0.80。文本到查询在200个样本上实现了0.80±0.06的准确率。多跳推理在500个HotpotQA问题上实现了0.46±0.04的精确匹配(EM),在50个样本上达到0.96±0.04的RAGAS忠诚度。除管道外,我们研究了针对困难多跳推理的多样性机制。在181个在零温度下无法解答的问题上,自一致性(k=5, T=0.7)通过单个Mixture-of-Experts(MoE)模型恢复最高达23%的EM,而跨模型oracle(3种架构×5个样本)达到46.4%。我们指出一种共识悖论:强烈的样本间共识反而信号集体幻觉,而非可靠答案,这呼应了Moussa{"i}d等人关于众包智慧的工作。在完整管道(500个问题)中,自一致性(k=3)将EM从0.46提升至0.48±0.04。置信路由级联机制(Phi-4→GPT-OSS,k=5)实现了0.55±0.04的EM,取得最佳结果,45.4%的问题被 reroute。最后,我们表明V3提示工程应用于其他模型无法复现Gemma-4所观察到的提升,确认特定的提示/模型相互作用。整个系统在单张RTX 3090上约5小时运行,无需任何训练,估算碳足迹为0.09 kg CO2 eq。

引用

@article{arxiv.2604.11104,
  title  = {Frugal Knowledge Graph Construction with Local LLMs: A Zero-Shot Pipeline, Self-Consistency and Wisdom of Artificial Crowds},
  author = {Pierre Jourlin},
  journal= {arXiv preprint arXiv:2604.11104},
  year   = {2026}
}

备注

Source code and raw results available: https://github.com/jourlin/synsynth (licence Hypocratic)