基于区块链的去中心化框架用于协作LLM评估:InfiCoEvalChain
人工智能
2026-02-10 v1 密码学与安全
机器学习
摘要
大型语言模型 (Large Language Model, LLM) 的快速发展对可靠评估提出了日益严格的要求,而现有的集中式评估又存在透明度不足、过拟合以及受硬件影响导致的方差问题。我们的实证分析揭示了现有评估中令人警惕的不一致性:单个模型在HumanEval上进行十次重复实验的标准差 (1.67) 实际上超过了官方排行榜中前十名模型之间的性能差距 (0.91),使得当前排名在统计上相当不稳健。为缓解这些不稳定性,我们提出了一个去中心化评估框架,通过在异构计算节点的大规模基准测试实现硬件和参数的多样性。凭借基于区块链的协议,该框架通过激励全球贡献者作为独立验证者,运用稳健的奖励系统确保评估的完整性并防止不诚实的参与。这种集体验证将评估从"集中式黑箱"转变为"去中心化背书",其中多方共识和多样化的推理环境将产生更稳定、更具代表性的指标。实验结果表明,去中心化评估框架将单个模型进行十次运行的标准差降至0.28。这种显著的改进超过了传统框架,确保了模型排名的更高统计置信水平。我们已完全实现该平台,并将很快向社区公开发布。
引用
@article{arxiv.2602.08229,
title = {InfiCoEvalChain: A Blockchain-Based Decentralized Framework for Collaborative LLM Evaluation},
author = {Yifan Yang and Jinjia Li and Kunxi Li and Puhao Zheng and Yuanyi Wang and Zheyan Qu and Yang Yu and Jianmin Wu and Ming Li and Hongxia Yang},
journal= {arXiv preprint arXiv:2602.08229},
year = {2026}
}