面向水力发电监管信息抽取的大型开源权重语言模型规模化分析
计算与语言
2025-11-18 v1 人工智能
摘要
使用大型语言模型从监管文件中进行信息抽取在性能与计算资源之间存在关键权衡。我们对0.6B至70B参数的七个开源权重模型在水力发电许可文件上进行评估,以提供实用的部署指导。我们的分析识别出14B参数阈值处,验证方法从无效(F1 < 0.15)转变为可行(F1 = 0.64)。消费级可部署模型通过适当的验证方法可达64% F1分数,而较小模型在51%处停滞。大规模模型接近77% F1,但需要企业级基础设施。我们识别出系统性幻觉模式,其中在较小模型中,完美的召回率指示抽取失败而非成功。我们的发现为开源权重信息抽取在监管上下文中的资源-性能映射提供了第一份综合性资料,为基于证据的模型选择提供支持。这些结果为水力发电合规提供了即时价值,同时为参数规模效应提供洞察,这些洞察可推广到信息抽取任务。
引用
@article{arxiv.2511.11821,
title = {Scaling Open-Weight Large Language Models for Hydropower Regulatory Information Extraction: A Systematic Analysis},
author = {Hong-Jun Yoon and Faisal Ashraf and Thomas A. Ruggles and Debjani Singh},
journal= {arXiv preprint arXiv:2511.11821},
year = {2025}
}
备注
18 pages, zero figures, Preprint submitted to Environmental Modeling and Software