中文

检索优于推理:用于能源改造推荐的语言模型成本控制基准

计量经济学 2026-07-03 v1 系统与控制

摘要

为建筑推荐正确的节能措施(ECM)集是一个结构化的多标签预测问题,其中特定任务的监督模型训练信号较弱,而通用语言模型则缺乏对当地建筑存量的了解。我们在 10,422 条真实的纽约市地方法律 87(LL87)能源审计记录上研究这个问题,以认证审计师实际推荐的 ECM 类别集作为真实值。我们做出了四项贡献。首先,我们确定能源使用强度(EUI)预测——上游任务——已被树集成有效解决:在十五个训练模型中,一个堆叠集成达到了决定系数 R^2 = 0.757,并且六个神经架构中的每一个都被梯度提升树超越。其次,我们表明推荐任务的框架设计主导了模型选择:将 ECM 推荐重新定义为 19 类多标签分类而不是单标签分类,将梯度提升树基线从先前报告的 25.9% 准确率提升到 0.571 的微 F1。第三,我们在一个 2x2 设计中基准测试了来自四个提供商的八个大型语言模型(LLM),该设计独立地切换检索依据和显式推理,并针对每个分支评估每标签 F1、每栋建筑的美元成本和延迟;检索增强生成(RAG)在每个模型上将微 F1 提高了 +0.11 到 +0.20,而显式推理在高达 8.4 倍的成本下没有产生可测量的准确性变化(-0.018 到 +0.010)。第四,我们表明 LLM 系统性地过度推荐——高召回率、低精确率——而检索主要通过提高精确率来缩小差距。一个 700 亿参数的开权重模型加上一个十五行的最近邻检索步骤,以每栋建筑 0.00032 美元的成本达到了 0.511 的微 F1,与前沿模型相当,但成本大约低 10.1 倍。

关键词

引用

@article{arxiv.2607.05440,
  title  = {Retrieval over Reasoning: A Cost-Controlled Benchmark of Language Models for Energy-Retrofit Recommendation},
  author = {Eliseo Curcio},
  journal= {arXiv preprint arXiv:2607.05440},
  year   = {2026}
}