噪声 AI 智能体 NTQR 评估的逻辑:完备公设与逻辑一致的误差相关性
人工智能
2023-12-12 v1
摘要
柏拉图在其“船之隐喻”(\textit{Republic}, Book VI, 488)中提出了一个问题——一群被认为对航海术知之甚少的水手,如何能在他们之中认出真正的舵手?该隐喻指出,当投票成员无知或存在偏见时,简单的多数投票程序无法安全地确定谁最具备掌舵资格。我们通过考虑在无监督环境中监控噪声 AI 智能体的 AI 安全问题,将柏拉图的担忧形式化。使用无标签数据评估 AI 智能体的算法将面临评估困境——我们如何知道评估算法本身是正确的?通过考虑观测响应的纯代数函数,可以避免这种无尽的验证链。我们可以构造完备的公设,以证明或反驳任何评分算法的逻辑一致性。当我们评估参加了 次测试、每次测试包含 道题目且每题有 种响应的 名专家时,存在一组完备的公设。我们讨论了仅参加单次测试的二元分类器的评估,即 测试。我们展示了其中一些公设先前已在机器学习文献中被识别但未被当作此类公设——即 Platanios 的 \textbf{agreement equations}。我们考虑了成对相关二元分类器的完备公设,并展示了它如何允许快速计算误差相关性。我们将基于集成误差独立假设的代数评估器与多数投票评分在 \uciadult 和 \texttt{two-norm} 数据集上的评估结果进行了比较。在整个过程中,我们展示了如何通过评估的代数公设实现逻辑一致性形式化,从而帮助提高使用 AI 算法的机器的安全性。
引用
@article{arxiv.2312.05392,
title = {The logic of NTQR evaluations of noisy AI agents: Complete postulates and logically consistent error correlations},
author = {Andrés Corrada-Emmanuel},
journal= {arXiv preprint arXiv:2312.05392},
year = {2023}
}
备注
18 pages, 9 figures, under review