中文

OracleProto:基于知识截止和时间掩码的 LLM 原生预测基准框架

人工智能 2026-05-06 v1

摘要

大型语言模型正从静态文本生成器向实际决策支持系统发展,其中预测是一种复合能力,关联信息收集、证据整合、情境判断和面向行动的决策制定。这种能力在金融、政策、产业和科学研究领域备受需求,但其评估面临困难:实时基准在事件解决前评估预测,因而最纯粹地衡量预测能力,但一旦事件解决即过期;回溯式基准可复现,但无法可靠区分真正的预测与模型在预训练期间可能已学习的事实。让模型拟真“不知情”无法替代真正的知识边界。我们提出了 OracleProto,一个用于评估 LLM 原生预测能力的可复现框架。OracleProto 通过结合模型截止时间对齐的样本录入、工具级时间掩码、内容级泄漏检测、离散答案规范化和分层评分,将已解决的事件构建为具有时限的预测样本。基于 FutureX-Past-derived 数据集实现,测试了六个当代 LLM,OracleProto 在受控信息边界下区分预测质量、抽样稳定性和成本效率,同时将残余泄漏降低至 1% 水平,远低于仅使用工具的时间过滤方式。OracleProto 将 LLM 预测从一次性评估转变为可审计、可复用且可训练的数据集水平能力,为公平跨模型比较和下游 SFT 与 RL 提供统一接口和受控信号来源。代码和数据已在 https://github.com/MaYiding/OracleProto 和 https://huggingface.co/datasets/MaYiding/OracleProto 提供。

关键词

引用

@article{arxiv.2605.03762,
  title  = {OracleProto: A Reproducible Framework for Benchmarking LLM Native Forecasting via Knowledge Cutoff and Temporal Masking},
  author = {Yiding Ma and Chengyun Ruan and Kaibo Huang and Zhongliang Yang and Linna Zhou},
  journal= {arXiv preprint arXiv:2605.03762},
  year   = {2026}
}