TEMPO:基于模式分离策略优化实现 LLM 后置测试的时间制约
机器学习
2026-05-20 v1
摘要
在历史事件上对大语言模型进行后置测试需要仅基于指定截止日期前可获得的信息进行推理。然而,模型常从预训练中泄露后截止知识,导致推理中误用事实,夸大 apparent accuracy,破坏评估有效性。基于提示的约束在被抑制内容与预测因果相关时会失败,而知识消除无法解决此问题,因为时间合规性是实例相关的:同一事实可能对一个截止日期是合法证据,却对另一个截止日期构成违规。我们提出 TEMPO(Temporal Enforcement via Mode-separated Policy Optimization),通过两种贡献实现对这种纪律的训练:(1)两种奖励模式,其中泄露模式驱动 post-cutoff 主张归零作为达到性能模式优化任务性能前的硬性前提;(2)基于 GRPO 的训练管道,使模型发现针对每个实例截止日期的时序有效推理策略。我们证明了训练单调降低泄露,收敛至无泄露最优解,并在达到合规后提升任务性能。在三个预测任务和两个模型上,TEMPO 将泄露率从 2~13% 降至 0.6~3.7%,且在强 pre-cutoff 信号存在的情境下提升 6~13% 任务性能,难题本身由有效信息支撑时保持性能。
引用
@article{arxiv.2605.18843,
title = {TEMPO: Temporal Enforcement via Mode-Separated Policy Optimization for Trustworthy LLM Backtesting},
author = {Zeyu Zhang and Bradly C. Stadie},
journal= {arXiv preprint arXiv:2605.18843},
year = {2026}
}
备注
9 pages in main context