概率向量的序关系与无监督性能估计
机器学习
2023-06-21 v1
摘要
无监督性能估计,即在无标注数据上评估模型表现,是一项困难任务。近来,Garg等人[2022]提出了一种远优于先前方法的新方法。他们的方法依赖于一个满足特定性质的打分函数,将分类器输出的概率向量映射到实数,但何种打分函数最优仍属开放问题。我们探究此问题:首先证明他们的方法从根本上依赖于该打分函数诱导的序关系。因此,在打分函数的单调变换下,其方法给出相同估计。接着,我们展示在二分类设定下,几乎所有常见打分函数——范数;范数;负熵;以及到均匀向量的、与Jensen-Shannon距离——均在概率向量上诱导相同序关系。然而,这在高维设定中不成立。我们在知名NLP数据集上进行了大量实验,并严格探究了不同打分函数的性能。我们得出结论:范数最为合适。
引用
@article{arxiv.2306.10160,
title = {On Orderings of Probability Vectors and Unsupervised Performance Estimation},
author = {Muhammad Maaz and Rui Qiao and Yiheng Zhou and Renxian Zhang},
journal= {arXiv preprint arXiv:2306.10160},
year = {2023}
}
备注
IJCAI 2023 Workshop on Generalizing from Limited Resources in the Open World