COMPL-AI 框架:面向欧盟人工智能法案的技术阐释与 LLM 基准测试套件
计算与语言
2025-02-04 v2 人工智能
计算机与社会
机器学习
摘要
欧盟人工智能法案(AI Act)是推动负责任人工智能发展的重要一步,但缺乏明确的技术阐释,使得评估模型合规性困难。本工作提出了 COMPL-AI 框架,包括(i)对欧盟 AI Act 第一次技术性阐释,将其宽泛的监管要求转化为可衡量的技术要求,聚焦于大型语言模型(LLM),以及(ii)一个开源的以法案为中心的基准测试套件,基于彻底调查并实现最先进的 LLM 基准测试。通过评估 12 个突出的 LLM,揭示了现有模型和基准测试在鲁棒性、安全性、多样性和公平性等方面的不足。这一工作凸显了需将注意力转向这些方面的必要性,鼓励 LLM 的平衡发展以及更全面的监管对齐基准测试。同时,COMPL-AI 首次展示了将法案义务带到更具体技术层面的可能性与挑战。因此,我们的工作可作为为模型提供者制定可操作建议的有用第一步,促进欧盟实施该法案的努力,例如撰写 GPAI 实践准则。
引用
@article{arxiv.2410.07959,
title = {COMPL-AI Framework: A Technical Interpretation and LLM Benchmarking Suite for the EU Artificial Intelligence Act},
author = {Philipp Guldimann and Alexander Spiridonov and Robin Staab and Nikola Jovanović and Mark Vero and Velko Vechev and Anna-Maria Gueorguieva and Mislav Balunović and Nikola Konstantinov and Pavol Bielik and Petar Tsankov and Martin Vechev},
journal= {arXiv preprint arXiv:2410.07959},
year = {2025}
}