中文

CryptoBench:面向加密货币领域的 LLM 智能体专家级动态基准测试

计算与语言 2026-05-18 v5

摘要

本文介绍 CryptoBench,这是首个面向大语言模型(LLM)智能体在加密货币领域进行严格评估的专家精选动态基准测试。不同于通用智能体基准测试用于搜索与预测,专业的加密分析呈现独特挑战:\emph{极端时效性\textsuperscript{*}、\emph{高度对抗性信息环境},以及必须\emph{综合来自多样化专业来源}(如链上情报平台和实时去中心化金融(DeFi)仪表板)的数据。CryptoBench 因此构成了更具挑战性和更具价值的智能体评估场景。为应对这些挑战,我们构建了一个动态基准测试,每个月提供 50 个问题,由加密领域专业人士精心设计,模拟实际分析师的工作流程。这些任务在四象限系统中被严格划分为:简单检索、复杂检索、简单预测和复杂预测。这种细粒度划分 enables 对智能体基础数据获取能力以及高级分析与预测技能进行精准评估。我们评估了十个 LLM,既直接使用也在智能体框架下使用,揭示了性能层级并发现了一种失效模式。我们观察到\textit{检索-预测失衡},即许多领先模型尽管擅长数据检索,却在需要预测分析的任务中表现突出。这凸显了智能体表面上看似基于事实而缺乏深入分析能力以整合信息的有害倾向。

关键词

引用

@article{arxiv.2512.00417,
  title  = {CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency},
  author = {Jiacheng Guo and Suozhi Huang and Zixin Yao and Yifan Zhang and Yifu Lu and Jiashuo Liu and Zihao Li and Nicholas Deng and Qixin Xiao and Jia Tian and Kanghong Zhan and Tianyi Li and Xiaochen Liu and Jason Ge and Chaoyang He and Kaixuan Huang and Lin Yang and Wenhao Huang and Mengdi Wang},
  journal= {arXiv preprint arXiv:2512.00417},
  year   = {2026}
}