运用AI对齐理论理解监管框架潜在风险
计算机与社会
2024-10-29 v1 人工智能
摘要
本文利用对齐理论(Alignment Theory, AT)研究中的见解——该理论主要关注人工智能技术对齐的潜在风险——对欧盟人工智能法案(EU AI Act)进行批判性审视。在AT研究中,已识别出若干关键失效模式,如代理游戏(proxy gaming)、目标漂移(goal drift)、奖励黑客(reward hacking)或规格游戏(specification gaming)。当AI系统未与其预期目标正确对齐时,这些问题可能就会出现。本报告的核心逻辑是:如果将监管努力视为我们对高级AI系统的同等对待,能从中学到什么?当我们系统性地将这些概念应用于欧盟人工智能法案后,便揭示了该法规潜在的漏洞和改进空间。
引用
@article{arxiv.2410.19749,
title = {Using AI Alignment Theory to understand the potential pitfalls of regulatory frameworks},
author = {Alejandro Tlaie},
journal= {arXiv preprint arXiv:2410.19749},
year = {2024}
}