ValueBlindBench: 面向 LLM 评估投资理由的协议化压力测试
人工智能
2026-05-05 v2 计算金融
摘要
基于 LLM 的金融智能体日益产生在结果可观测之前就给出投资理由。这导致延迟性真实评估问题:实现的收益最终是投资质量的仲裁者,但它们到达得太晚且太嘈杂,难以指导许多模型开发和治理决策。LLM 评判者为评估 AI 金融系统提供了一个诱人的捷径,但未经验证的评判者可能奖励语篇、自信或 Rubric 模仿,而非金融判断。本文介绍 ValueBlindBench,这是一个预先登记的协议化压力测试,用于决定 LLM 评估的投资理由声明是否可发布、有资格或无效。在一个包含 1000 次诚实决策循环和 100 个预先登记的对抗控制 (1100 条轨迹,5500 次评判调用) 的受控市场状态资本配置原型中,ValueBlindBench 在 处清除了总体协议门槛,但防止了多个过度宣称。低排名系统坍缩为平局类别,其中一个 Rubric 维度未通过单维度门槛 (constraint_awareness,),单位评判者的排名具有家庭依赖性,简短正确的理由相对于诚实理由接受 的 Rubric 分数惩罚。针对性的锚定特定性探针进一步显示,诸如约束意识等金融构造在操作上具有支撑性。因此,科学目标并非排行榜,也不声称衡量真实投资技能。ValueBlindBench 是 AI 金融评估的预校准计量层:它支配提出的 LLM 评判者基于投资理由的声明是否稳定、一致、无污染 enough 以被报告。
引用
@article{arxiv.2604.25224,
title = {ValueBlindBench: Agreement-Gated Stress Testing of LLM-Judged Investment Rationales Before Returns Are Observable},
author = {Sidi Chang and Peiying Zhu and Yuxiao Chen},
journal= {arXiv preprint arXiv:2604.25224},
year = {2026}
}
备注
10 pages, Submitted to IEEE Computational Intelligence in Financial Engineering and Economics (CIFEr) 2026, Tokyo, Japan