中文

欺骗性对齐监控

机器学习 2023-07-27 v2 人工智能

摘要

随着大型机器学习模型能力的持续增长,以及赋予此类模型的自主性不断扩展,一个新对手的阴影浮现:模型自身。模型可能以看似合理的方式行事,同时秘密且微妙地因不正当原因修改其行为,这种威胁在AI安全与对齐社区中常被称为欺骗性对齐(deceptive alignment)。因此,我们称这一新方向为欺骗性对齐监控。本工作中,我们识别了多元机器学习子领域中新兴的方向,认为它们在不远的将来对欺骗性对齐监控将变得日益重要且相互交织,并论证这些领域的进展既带来长期挑战也带来新的研究机遇。最后我们倡导对抗机器学习社区更多地参与这些新兴方向。

关键词

引用

@article{arxiv.2307.10569,
  title  = {Deceptive Alignment Monitoring},
  author = {Andres Carranza and Dhruv Pai and Rylan Schaeffer and Arnuv Tandon and Sanmi Koyejo},
  journal= {arXiv preprint arXiv:2307.10569},
  year   = {2023}
}

备注

Accepted as BlueSky Oral to 2023 ICML AdvML Workshop