中文

AI 是否能够进行能源改造决策?对大语言模型的评估

人工智能 2026-02-02 v1

摘要

传统的建筑能源改造决策方法存在可泛化性有限和可解释性低的局限,阻碍了在多样化的住宅场景中的应用。随着智能互联社区的发展,生成式人工智能,特别是大语言模型(LLM),可能通过处理上下文信息并生成实践者可读的建议来提供帮助。我们对七种大语言模型(ChatGPT、DeepSeek、Gemini、Grok、Llama和Claude)进行了评估,其在住宅改造决策中分别以两个目标进行操作:最大化二氧化碳减排(技术目标)和最小化投资回报期(社会技术目标)。性能在四个维度上进行评估:准确性、一致性、灵敏度和推理能力,使用来自49个美国州400套住宅的数据集。大语言模型在许多情况下能够生成有效建议,在不进行微调的情况下达到最高54.5%的TOP1匹配率和92.8%的TOP5匹配率。技术目标的表现优于社会技术决策,后者受经济权衡和当地背景限制。不同模型之间的一致性较低,表现更好的模型倾向于与其他模型分歧。大语言模型对位置和建筑几何形状敏感,但对技术和居民行为不够敏感。大多数模型显示出逐步的、类似工程的方式的推理,但往往简化且缺乏更深层的背景意识。总体而言,大语言模型是能源改造决策的有前景的助理,但在准确性、一致性和上下文处理方面仍需改进,以实现可靠的实践应用。

关键词

引用

@article{arxiv.2509.06307,
  title  = {Can AI Make Energy Retrofit Decisions? An Evaluation of Large Language Models},
  author = {Lei Shu and Dong Zhao},
  journal= {arXiv preprint arXiv:2509.06307},
  year   = {2026}
}