中文

StakeBench:基于市场承诺评估语言理解

计算与语言 2026-05-26 v1 人工智能 综合金融

摘要

现有的金融 NLP 基准测试通常依赖外部观察者提供的标签,衡量的是语言的感知而非说话人在市场中所作出的承诺。我们引入 StakeBench,一个以市场承诺为基础的语言理解评估框架。StakeBench 将 560,876 条评论链接到来自 Polymarket 和 Manifold 的验证持仓、行动和 market-odds 记录。监督来自可观测的市场行为。位置 sides、发帖后的交易行动和 market-odds 轨迹取代人工标注。四个诊断任务测试模型是否检测市场承诺、识别披露的 sides、预测未来行动以及执行集体 odds 投影。三个 commitment-aware 指标衡量与披露偏好一致性而非感知情感。有效性审计和明确的解释边界帮助区分可观测的承诺信号与潜在信念以及因果 market-odds 影响。我们在 15 个 LLM 和 18 个主题及平台设置中测试,模型在恢复位置 sides 信号方面部分成功,Directed Accuracy 在 0.506 到 0.599 之间,但在后续任务中表现出结构性失败。十个模型在未来行动预测中坍缩为一个或两个行动标签,在集体 odds 投影中没有模型在朴素的 odds-direction 基准上持续改进。模型规模与性能不相关,金融领域微调不提高披露 sides 识别,平台激励strongly 影响高阶结果。StakeBench 附带评估代码和数据集,采用 CC-BY 4.0 许可。

关键词

引用

@article{arxiv.2605.26074,
  title  = {StakeBench: Evaluating Language Understanding Grounded in Market Commitment},
  author = {Yunhua Pei and Jingyu Hu and Yiwei Shi and Hongnan Ma and Weiru Liu and John Cartlidge},
  journal= {arXiv preprint arXiv:2605.26074},
  year   = {2026}
}

备注

21 pages, 2 figures, 20 tables. Preprint. Dataset and evaluation code included