可重放的金融代理:面向工具使用 LLM 代理的确定性-忠实度保证框架
摘要
LLM 代理在监管审计重放方面存在困难:当被要求使用相同的输入重现被标记的交易决策时,许多部署无法返回一致的结果。我们引入了确定性-忠实度保证框架(DFAH),这是一个用于测量部署在金融服务中的工具使用代理的轨迹确定性、决策确定性和证据条件忠实度的框架。在 4,700 多次代理运行(7 个模型,4 个提供商,3 个金融基准,每个基准在 T=0.0 下包含 50 个案例)中,我们发现决策确定性与任务准确率之间没有可检测的相关性(r = -0.11,95% CI [-0.49, 0.31],p = 0.63,n = 21 个配置):模型可以是确定的但不准确,也可以是准确的但不确定。由于在我们的样本中这两个指标都不能互相预测,因此必须独立测量它们,这正是 DFAH 所提供的。小模型(7-20B)通过以牺牲准确率(20-42%)为代价的严格模式匹配实现了近乎完美的确定性,而前沿模型表现出中等程度的确定性(50-96%)和可变的准确率。没有模型能同时实现完美的确定性和高准确率,这支持了 DFAH 的多维测量方法。我们提供了三个金融基准(合规分类、投资组合约束和 DataOps 异常;各 50 个案例)以及一个开源压力测试框架。在这些基准和 DFAH 评估设置中,采用模式优先架构的 Tier 1 模型达到了与审计重放要求一致的确定性水平。
引用
@article{arxiv.2601.15322,
title = {Replayable Financial Agents: A Determinism-Faithfulness Assurance Harness for Tool-Using LLM Agents},
author = {Raffi Khatchadourian},
journal= {arXiv preprint arXiv:2601.15322},
year = {2026}
}
备注
27 pages, 5 figures, 9 tables | Code and data: https://github.com/ibm-client-engineering/output-drift-financial-llms | To appear in the 2nd ICLR Workshop on Advances in Financial AI: Towards Agentic and Responsible Systems (ICLR 2026)