中文

监管策略可以塑造通用人工智能模型的长期风险管理

人工智能 2025-06-12 v2 计算机与社会 社会与信息网络

摘要

通用人工智能(GPAI)模型(包括大型语言模型(LLM))的快速普及和部署给AI监管实体带来了前所未有的挑战。我们假设这些实体将需要应对一个新兴的风险和事件报告生态系统,这很可能超出其监管能力。为了研究这一点,我们开发了一个模拟框架,其参数来自风险、事件或危害报告生态系统的多样化景观中提取的特征,包括社区驱动平台、众包倡议和专家评估。我们评估了四种监管策略:非优先级(先到先服务)、随机选择、基于优先级(首先处理最高优先级风险)和多样性优先(平衡高风险与跨风险类型的全面覆盖)。我们的结果表明,虽然基于优先级和多样性优先的策略在减轻高影响风险(特别是专家识别的风险)方面更有效,但它们可能无意中忽视更广泛社区报告的系统性问题。这种疏忽可能产生反馈循环,放大某些类型的报告而抑制其他类型,导致对整体风险格局的扭曲认知。我们使用几个真实世界数据集验证了我们的模拟结果,其中包括一个包含超过一百万次ChatGPT交互的数据集,其中超过15万次对话被识别为有风险。这一验证强调了AI风险监管中固有的复杂权衡,并突出了风险管理策略的选择如何塑造社会中使用的多样化GPAI模型的未来AI风险格局。

关键词

引用

@article{arxiv.2501.06137,
  title  = {Supervision policies can shape long-term risk management in general-purpose AI models},
  author = {Manuel Cebrian and Emilia Gomez and David Fernandez Llorca},
  journal= {arXiv preprint arXiv:2501.06137},
  year   = {2025}
}

备注

24 pages, 14 figures