人工智能基准测试与数据集用于大语言模型评估
分布式、并行与集群计算
2024-12-03 v1 人工智能
摘要
大语言模型(LLMs)在预训练和微调方面需要巨大的计算资源,由于模型规模大,要求分布式计算能力。其复杂的架构在整个AI生命周期内都可能造成挑战,包括数据收集、部署和监控。针对解释性、可纠错性、可解释性和幻觉等关键AI系统挑战,需要系统的方法论和严格的基准测试。为了有效改进AI系统,我们必须通过定量评估精确识别系统性漏洞,以增强系统可信度。欧洲议会于2024年3月13日通过了欧盟AI法案,首次建立了针对AI系统开发、部署和使用的全面欧盟要求,进一步凸显了诸如Z-Inspection等工具和方法论的重要性。这凸显了需要通过实用基准测试丰富该方法论,以有效应对AI系统提出的技术挑战。为此,我们启动了一个项目,是AI安全保加利亚计划的一部分,旨在收集和分类AI基准测试,从而使实践者能够在AI系统生命周期中识别并利用这些基准测试。
关键词
引用
@article{arxiv.2412.01020,
title = {AI Benchmarks and Datasets for LLM Evaluation},
author = {Todor Ivanov and Valeri Penchev},
journal= {arXiv preprint arXiv:2412.01020},
year = {2024}
}
备注
November 2024 v1.0