中文

CryptoAnalystBench:多工具长形式LLM分析中的失效

信息检索 2026-03-26 v1 人工智能 密码学与安全

摘要

现代分析师智能体必须处理复杂的高token输入,包括数十个检索文档、工具输出和时序敏感数据。虽然先前工作产生了工具调用基准测试并探讨了知识增强系统的事实性,但相对较少的工作研究了它们的交叉作用:即LLM必须整合大量动态、结构化和非结构化多工具输出的情形。我们使用加密货币作为代表性高数据密度领域,研究LLM在此情境下的失效模式。我们引入(1)CryptoAnalystBench,这是一个包含198个生产加密货币和DeFi查询、跨越11个类别的分析师对齐基准测试;(2)一个配备相关加密货币和DeFi工具以生成多个前沿LLM响应的智能体套件;(3)一个包含引用验证和基于LLM的评判标准的评估管道,这些标准跨越四个用户定义的成功维度:相关性、时序相关性、深度和数据一致性。通过人工标注,我们发展了七种高阶错误类型的分类学,这些错误类型不被事实性检查或LLM基于质量评分可靠地捕获。我们发现,即使在最先进的系统中,这些失效仍然存在,并且可能损害高风险决策。基于这一分类学,我们完善了评判标准,以更好地捕获这些错误。虽然评判器在评分迭代中不与人工标注员在精确评分方面保持一致,但可靠地识别关键失效模式,为开发人员和研究人员研究分析师风格智能体提供可扩展的反馈。我们发布CryptoAnalystBench,包括已标注查询、评估管道、评判标准和错误分类学,并概述了评估长形式、多工具增强系统的缓解策略和开放挑战。

关键词

引用

@article{arxiv.2602.11304,
  title  = {CryptoAnalystBench: Failures in Multi-Tool Long-Form LLM Analysis},
  author = {Anushri Eswaran and Oleg Golev and Darshan Tank and Sidhant Rahi and Himanshu Tyagi},
  journal= {arXiv preprint arXiv:2602.11304},
  year   = {2026}
}