中文

目标误泛化:为何正确规范不足以达成正确目标

机器学习 2022-11-03 v2

摘要

AI对齐领域关注追求非预期目标的AI系统。一种常被研究的非预期目标产生机制是指定博弈(specification gaming),即设计者提供的规范存在设计者未预见到的缺陷。然而,即使规范正确,AI系统也可能追求不合意的目标,这种情况称为目标误泛化(goal misgeneralization)。目标误泛化是学习算法的一种特定鲁棒性失效形式,其中学到的程序熟练地追求一个不合意的目标,该目标在训练情境中表现良好,但在新颖测试情境中表现糟糕。我们通过提供深度学习中跨多个领域的若干实例,证明目标误泛化可能在实际系统中发生。向前外推至能力更强的系统,我们给出假想情景以说明目标误泛化如何导致灾难性风险。我们建议了若干研究方向,可降低未来系统发生目标误泛化的风险。

关键词

引用

@article{arxiv.2210.01790,
  title  = {Goal Misgeneralization: Why Correct Specifications Aren't Enough For Correct Goals},
  author = {Rohin Shah and Vikrant Varma and Ramana Kumar and Mary Phuong and Victoria Krakovna and Jonathan Uesato and Zac Kenton},
  journal= {arXiv preprint arXiv:2210.01790},
  year   = {2022}
}