中文

概率向量的序关系与无监督性能估计

机器学习 2023-06-21 v1

摘要

无监督性能估计,即在无标注数据上评估模型表现,是一项困难任务。近来,Garg等人[2022]提出了一种远优于先前方法的新方法。他们的方法依赖于一个满足特定性质的打分函数,将分类器输出的概率向量映射到实数,但何种打分函数最优仍属开放问题。我们探究此问题:首先证明他们的方法从根本上依赖于该打分函数诱导的序关系。因此,在打分函数的单调变换下,其方法给出相同估计。接着,我们展示在二分类设定下,几乎所有常见打分函数——LL^\infty范数;L2L^2范数;负熵;以及到均匀向量的L2L^2L1L^1与Jensen-Shannon距离——均在概率向量上诱导相同序关系。然而,这在高维设定中不成立。我们在知名NLP数据集上进行了大量实验,并严格探究了不同打分函数的性能。我们得出结论:LL^\infty范数最为合适。

关键词

引用

@article{arxiv.2306.10160,
  title  = {On Orderings of Probability Vectors and Unsupervised Performance Estimation},
  author = {Muhammad Maaz and Rui Qiao and Yiheng Zhou and Renxian Zhang},
  journal= {arXiv preprint arXiv:2306.10160},
  year   = {2023}
}

备注

IJCAI 2023 Workshop on Generalizing from Limited Resources in the Open World