语言模型预测器的一致性检查
机器学习
2025-01-13 v2 人工智能
计算与语言
机器学习
摘要
预测是一项难以评估的任务:事实依据只能在未来才知晓。近期表明大语言模型(LLM)预测器迅速接近人类水平的研究,引发了一个问题:我们如何对这些预测器进行即时基准测试和评估?在一致性检查框架下,我们以预测在不同逻辑相关问题上的一致性来衡量预测器的性能。我们提出了一种新的通用一致性指标,基于套利(arbitrage)原理进行度量;例如,如果一个预测AI不合理地预测2024年美国总统大选中,民主党和共和党各自赢得60%的概率,那么一个套利者就可以针对预测器的预测进行交易并获取利润。我们构建了一个自动化评估系统,用于生成一组基础问题、从这些问题实例化一致性检查、征集预测器的预测,并衡量预测的一致性。我们随后构建了一个标准且符合评分规则的预测基准,表明我们的(即时)一致性指标与LLM预测器的真实Brier分数(该分数仅在未来才知晓)呈正相关。我们还发布了一个将在2028年解决的一致性基准,为预测提供了一个长期评估工具。
引用
@article{arxiv.2412.18544,
title = {Consistency Checks for Language Model Forecasters},
author = {Daniel Paleka and Abhimanyu Pallavi Sudhir and Alejandro Alvarez and Vineeth Bhat and Adam Shen and Evan Wang and Florian Tramèr},
journal= {arXiv preprint arXiv:2412.18544},
year = {2025}
}
备注
55 pages, 25 figures. Submitted to ICLR 2025