DMind 基准:面向 Web3 领域的 LLM 能力全面评估
密码学与安全
2025-11-05 v3 人工智能
摘要
大型语言模型(LLM)在多样化的自然语言处理任务中取得了惊人的性能,但像 Web3 这样的专业领域 presents new challenges and requires more tailored evaluation。尽管 Web3 拥有庞大的用户基础和资本流动,涵盖智能合约、去中心化金融(DeFi)、非同质化代币(NFT)、去中心化自治组织(DAO)、链上治理以及新型代币经济,但尚无综合性基准系统性评估 LLM 在该领域的性能。为填补这一空白,我们介绍了 DMind 基准,这是一个覆盖九个关键子领域的全面 Web3 导向评估套件:基本区块链概念、区块链基础设施、智能合约、DeFi 机制、DAO、NFT、代币经济、 meme 概念和安全漏洞。除多选题外,DMind 基准还包含合约调试和链上数值推理等领域特定任务,模拟真实场景。我们评估了 26 个模型,包括 ChatGPT、Claude、DeepSeek、Gemini、Grok 和 Qwen,发现该领域的专门区域(如代币经济和安全关键合约分析)存在显著的性能差距。尽管某些模型在区块链基础设施任务中表现突出,但高级子领域仍具有挑战性。我们的基准数据集和评估管道已开源于 https://huggingface.co/datasets/DMindAI/DMind_Benchmark,发布后一周内登上 Hugging Face 热门数据集图榜第一名。
引用
@article{arxiv.2504.16116,
title = {DMind Benchmark: Toward a Holistic Assessment of LLM Capabilities across the Web3 Domain},
author = {Enhao Huang and Pengyu Sun and Zixin Lin and Alex Chen and Joey Ouyang and Haobo Wang and Kaichun Hu and James Yi and Frank Li and Zhiyu Zhang and Tianxiang Xu and Gang Zhao and Ziang Ling and Lowes Yang},
journal= {arXiv preprint arXiv:2504.16116},
year = {2025}
}