中文

上游与下游 AI 安全:同在一条河上?

计算机与社会 2025-01-13 v1 人工智能

摘要

传统的安全工程在其使用语境下评估系统,例如自动驾驶车辆(包括使用 AI 的车辆)的运行设计域(道路布局、限速、天气等)。我们将此称为下游安全。相比之下,关于前沿 AI(例如可针对下游任务进行进一步训练的大型语言模型)的安全研究,通常考虑的是超越特定应用语境的因素,例如模型逃避人类控制的能力,或产生有害内容(例如如何制造炸弹)的能力。我们将此称为上游安全。我们概述了上游和下游安全框架的特征,然后探讨了广泛的 AI 安全社区能在多大程度上从这些框架之间的协同中受益。例如,下游安全中的共模失效等概念能否用于帮助评估 AI 护栏的强度?此外,对前沿 AI 能力与局限性的理解能否用于为下游安全分析提供信息,例如在将 LLM 微调以计算自主船舶航次计划时?本文确定了一些值得探索的有前景的方向,并概述了在上游与下游安全框架之间实现协同或合流所面临的一些挑战。

关键词

引用

@article{arxiv.2501.05455,
  title  = {Upstream and Downstream AI Safety: Both on the Same River?},
  author = {John McDermid and Yan Jia and Ibrahim Habli},
  journal= {arXiv preprint arXiv:2501.05455},
  year   = {2025}
}