气候变化LLM基准测试的用户需求偏差
计算与语言
2026-03-30 v1
摘要
气候变化是塑造公共决策和政策讨论的重大社会科学问题。随着大型语言模型(LLM)日益用作获取气候知识的界面,是否已有基准测试反映了用户需求对于评估LLM在真实场景中的应用至关重要。我们提出了“主动知识行为框架”,以捕捉不同人类-人类和人类-AI知识寻求与提供行为。我们进一步开发了主题-意图-形式(taxonomy)模型,用于分析代表不同知识行为的气候相关数据。我们的结果揭示,当前基准测试与真实用户需求之间存在显著偏差,而人类与LLM之间的知识交互模式与人类-人类交互模式密切相关。这些发现为基准测试设计、RAG系统开发和LLM训练提供了可操作的指导。代码已公开于https://github.com/OuchengLiu/LLM-Misalign-Climate-Change。
引用
@article{arxiv.2603.26106,
title = {LLM Benchmark-User Need Misalignment for Climate Change},
author = {Oucheng Liu and Lexing Xie and Jing Jiang},
journal= {arXiv preprint arXiv:2603.26106},
year = {2026}
}
备注
37 pages (8 main), 31 figures, 14 tables