中文

优化 Top-k 曲线下部分面积:理论与实践

机器学习 2024-07-11 v1 人工智能

摘要

由于类别之间不可避免的语义模糊性,Top-k 误差已成为大规模分类基准中一种流行的度量指标。现有关于 top-k 优化的文献通常聚焦于 top-k 目标函数的优化方法,而忽略了度量本身存在的局限性。在本文中,我们指出 top-k 目标缺乏足够的区分能力,以至于所诱导的预测可能将一个完全不相关的标签排在前列。为修复该问题,我们提出了一种名为 top-k 曲线下部分面积(AUTKC)的新度量。理论分析表明,AUTKC 具有更好的区分能力,且其贝叶斯最优分数函数能够针对条件概率给出正确的 Top-K 排序。这说明 AUTKC 不允许不相关标签出现在前列列表中。此外,我们提出了一种经验代理风险最小化框架来优化所提出的度量。理论上,我们给出了(1)贝叶斯最优分数函数 Fisher 一致性的一个充分条件;(2)在简单超参数设置下对类别数不敏感的一个泛化上界。最后,在四个基准数据集上的实验结果验证了我们提出框架的有效性。

关键词

引用

@article{arxiv.2209.01398,
  title  = {Optimizing Partial Area Under the Top-k Curve: Theory and Practice},
  author = {Zitai Wang and Qianqian Xu and Zhiyong Yang and Yuan He and Xiaochun Cao and Qingming Huang},
  journal= {arXiv preprint arXiv:2209.01398},
  year   = {2024}
}