disagreement experts 之间的逻辑一致性及其在AI安全中的作用
人工智能
2025-10-02 v1
摘要
如果两个专家在同一测试上意见不一致,我们可能会得出结论:两者都不可能100%正确。但如果他们完全一致,就没有任何可能的评估会被排除。本文通过形式化化建模一个无监督评估逻辑来探讨这种关于一致性与不一致性效用不对称性。该逻辑的核心问题是计算与我们观察到的专家决策一致和不一致相一致的群体评估集合。对其一致决策的统计摘要是整数空间中可能正确或错误响应的线性规划问题的输入。显而易见的逻辑约束(例如,正确响应的数量不能超过观察到的响应数量)是不等式。但此外,存在适用于所有有限测试的普适适用性线性等式。通过仅使用逻辑一致性的无知识报警构建演示了该方法的实际和即时效用,这些报警可以检测一个或多个作为评判员的LLM是否违反了用户指定的最低评分阈值。
引用
@article{arxiv.2510.00821,
title = {Logical Consistency Between Disagreeing Experts and Its Role in AI Safety},
author = {Andrés Corrada-Emmanuel},
journal= {arXiv preprint arXiv:2510.00821},
year = {2025}
}
备注
10 pages, 7 figures