中文

EU-Agent-Bench:测量LLM代理在欧盟法律下非法行为

人工智能 2025-10-27 v1

摘要

大型语言模型(LLM)越来越多地被用作各种情境下的代理人,提供工具供其使用。然而,LLM代理可能 exhibit 不可预测的行为,包括采取不可取和/或不安全的行动。为了衡量LLM代理在欧盟立法背景下采取非法行动的潜在倾向,我们引入EU-Agent-Bench,这是一个可验证的人类精选基准,评估代理人在用户输入可能导致非法行动的情境下与欧盟法律规范的对齐程度。我们的基准涵盖数据保护、偏见/歧视和科学完整性等多个类别的情景,每个用户请求都允许执行合规和非合规的动作。我们将模型的函数调用与以法律条文引用为支撑的详尽评分标准进行比较,评估前沿LLM的合法合规性,并进一步研究在系统提示中提供相关立法摘录并附有明确合规指令的合规效果。我们发布了公开预览集合供研究社区使用,同时保留私人测试集以防止在评估新模型时出现数据污染。我们鼓励未来的工作将代理安全基准扩展到不同的法律司法管辖区以及多轮和多语言交互。我们的代码已发布在\href{https://github.com/ilijalichkovski/eu-agent-bench}{此 URL}。

关键词

引用

@article{arxiv.2510.21524,
  title  = {EU-Agent-Bench: Measuring Illegal Behavior of LLM Agents Under EU Law},
  author = {Ilija Lichkovski and Alexander Müller and Mariam Ibrahim and Tiwai Mhundwa},
  journal= {arXiv preprint arXiv:2510.21524},
  year   = {2025}
}

备注

Accepted at the Workshop on Regulatable ML at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)