基于 LLM 的生态模型评估策略提取
人工智能
2025-05-21 v1
摘要
对生态时间序列的评估对于许多重要应用的模型性能基准至关重要,包括预测温室气体通量、捕捉碳氮动态以及监测水循环。传统的数值指标(如 R-squared、均方根误差)已被广泛用于量化模型化观察生态系统变量之间的相似性,但它们往往无法捕捉生态过程中关键的时序模式。因此,这些方法常伴随专家可视化检查,后者需要大量人力且限制了大规模评估的适用性。为解决这些挑战,我们提出了一种新框架,将 metric learning 与大型语言模型 (LLM) 基于自然语言的 policy extraction 集成,以开发可解释的评估准则。该提议的方法处理成对注释,实施 policy optimization 机制来生成和组合不同的评估指标。在用于评估作物 gross primary production 和二氧化碳通量预测的多个数据集上的结果表明,所提方法在捕捉目标 assessment preferences 方面有效,包括合成生成的和专家注释的模型比较。该提议的框架填补了数值指标与专家知识之间的鸿沟,同时提供可解释的评估 policies 以适应不同生态系统建模研究的多样化需求。
引用
@article{arxiv.2505.13794,
title = {LLM-based Evaluation Policy Extraction for Ecological Modeling},
author = {Qi Cheng and Licheng Liu and Qing Zhu and Runlong Yu and Zhenong Jin and Yiqun Xie and Xiaowei Jia},
journal= {arXiv preprint arXiv:2505.13794},
year = {2025}
}