中文

用于误对齐二分类器的逻辑警报

机器学习 2024-09-18 v1 人工智能

摘要

如果两个智能体在决策上存在分歧,我们可能会怀疑它们并非都正确。这一直觉被形式化,用于评估执行二分类任务的智能体。它们在联合测试中的一致与分歧使我们能够建立与其响应逻辑一致的唯一群体评估。这是通过建立一组公理(代数关系)来实现的,这些公理必须被二分类响应者的所有评估普遍遵守。对于每个大小为N的集成,都存在一组完整的此类公理。使用N=1,2时的公理构建了一个完全逻辑的警报——它能够仅使用未标记数据证明集成中至少有一个成员出现故障。讨论了该方法与形式化软件验证的相似性及其对近期安全有保障AI议程的实用性。

关键词

引用

@article{arxiv.2409.11052,
  title  = {A logical alarm for misaligned binary classifiers},
  author = {Andrés Corrada-Emmanuel and Ilya Parker and Ramesh Bharadwaj},
  journal= {arXiv preprint arXiv:2409.11052},
  year   = {2024}
}

备注

17 pages, 7 figures, under review