中文

关于善有法则

机器学习 2024-10-15 v1 人工智能 机器学习 统计理论 统计理论

摘要

“当度量成为目标时,它就不再是好的度量”,这一谚语称为善有法则。本文对此法则进行形式化探讨,并证明其关键取决于真实目标与优化度量之间偏差的尾分布。具有长尾分布的偏差有利于善有法则,即优化度量对目标可能产生反效果。我们提供了一种形式化setting,用于通过研究当度量被优化时,目标与度量之间相关性的渐近行为来评估善有法则。此外,我们引入了善有法则的区分:当过度优化度量对真实目标无用时称为弱善有法则;当过度优化度量对真实目标有害时称为强善有法则。我们证明,这一区分取决于尾分布。我们强调这一结果对大规模决策和基于度量的政策(以及必须基于度量的政策)具有深远影响,并提出诸多研究方向以更好地评估这些政策在一般情况下的安全性,特别是这些政策由算法自动化的情况。

关键词

引用

@article{arxiv.2410.09638,
  title  = {On Goodhart's law, with an application to value alignment},
  author = {El-Mahdi El-Mhamdi and Lê-Nguyên Hoang},
  journal= {arXiv preprint arXiv:2410.09638},
  year   = {2024}
}

备注

47 pages, 11 figures