从检查器到预测器:延迟真值下模型生成战略路线的代码自有评估
人工智能
2026-07-13 v1
摘要
许多对模型输出的评估要么依赖于评估时可检查的契约,要么依赖于在操作循环内到达的反馈。我们研究了真值延迟、删失或私有的互补设置,因此确定性代码无法在评分时检查正确性,而必须发布代码自有的临时预测。RouteCast为模型生成的类型化战略路线实例化了这种机制:模型提出候选路线和结构化因素;时点证据、参考类别和确定性变换产生临时预测排名;后续结果评估该预测。在一项针对21个二元结果案例(6个阳性,15个阴性)的回顾性风险投资试点中,整体包RouteCast评分显示出初步的回顾性区分能力(AUC 0.756,95% CI [0.471,0.980]),而盲法LLM评审员达到AUC 0.678 [0.419,0.897],身份暴露的LLM评审员达到AUC 0.761 [0.515,0.944],这与识别或结果相关的泄漏风险一致。在同一二元子集上进行的预注册分解消融发现,将相同输入转换为类型化分阶段路线与整体包评分(Delta AUC = -0.144,95% CI [-0.471,0.176])以及确定性启发式方法(Delta AUC = -0.089,95% CI [-0.412,0.278])无法区分。该试点建立了可审计的可行性结果并暴露了失败模式;它并未建立前瞻性校准、因果决策改进、路线分解优势或跨领域有效性。
引用
@article{arxiv.2607.10972,
title = {From Checker to Forecaster: Code-Owned Evaluation of Model-Generated Strategic Routes Under Delayed Ground Truth},
author = {Aleh Manchuliantsau},
journal= {arXiv preprint arXiv:2607.10972},
year = {2026}
}
备注
11 pages, 2 figures