AI评估器应优化什么?
机器学习
2025-02-04 v1 人工智能
摘要
AI评估器是一个外部的、理想情况下独立的系统,用于预测另一个AI系统的某个指标,例如损失值。评估器可以利用来自许多其他AI系统测试结果的信息,并且可以灵活地在任何损失函数或评分规则上进行训练:从平方误差到毒性指标。本文探讨的问题是:始终针对目标指标训练评估器是否总是最优的?或者,针对一个不同的指标进行训练,然后将预测映射回目标指标是否会更好?我们利用表格数据的二十个回归和分类问题,分别针对回归损失和具有单调及非单调映射的分类评分,通过实验探索了这个问题,并发现与直觉相反,针对信息量更大的指标进行优化通常并非更好。令人惊讶的是,某些单调变换很有前景。例如,逻辑损失有助于最小化回归中的绝对误差或二次误差,而对数评分有助于最大化分类中的二次评分或球面评分。
引用
@article{arxiv.2502.00365,
title = {What should an AI assessor optimise for?},
author = {Daniel Romero-Alvarado and Fernando Martínez-Plumed and José Hernández-Orallo},
journal= {arXiv preprint arXiv:2502.00365},
year = {2025}
}