中文

运用AI对齐理论理解监管框架潜在风险

计算机与社会 2024-10-29 v1 人工智能

摘要

本文利用对齐理论(Alignment Theory, AT)研究中的见解——该理论主要关注人工智能技术对齐的潜在风险——对欧盟人工智能法案(EU AI Act)进行批判性审视。在AT研究中,已识别出若干关键失效模式,如代理游戏(proxy gaming)、目标漂移(goal drift)、奖励黑客(reward hacking)或规格游戏(specification gaming)。当AI系统未与其预期目标正确对齐时,这些问题可能就会出现。本报告的核心逻辑是:如果将监管努力视为我们对高级AI系统的同等对待,能从中学到什么?当我们系统性地将这些概念应用于欧盟人工智能法案后,便揭示了该法规潜在的漏洞和改进空间。

关键词

引用

@article{arxiv.2410.19749,
  title  = {Using AI Alignment Theory to understand the potential pitfalls of regulatory frameworks},
  author = {Alejandro Tlaie},
  journal= {arXiv preprint arXiv:2410.19749},
  year   = {2024}
}