基于人类水平框架评估视觉数据集与模型
计算机视觉与模式识别
2024-09-09 v1
摘要
计算机视觉领域中模型和数据集的评估仍是一个具有挑战性的问题,大多数排行榜仅依赖准确率。虽然准确率是模型评估的流行指标,但它仅通过考虑单个模型在所有数据集项目上的得分来提供粗略的评估。本文探索了项目反应理论(IRT),该理论框架用于推断来自多个模型和每个数据集项目的可解释潜在参数,从而实现超越单一准确率数字的更丰富的评估与分析。利用IRT,我们评估了模型校准、选择信息性数据子集,并展示了其潜在参数在分析和比较计算机视觉中的模型和数据集的有用性。
引用
@article{arxiv.2409.04041,
title = {On Evaluation of Vision Datasets and Models using Human Competency Frameworks},
author = {Rahul Ramachandran and Tejal Kulkarni and Charchit Sharma and Deepak Vijaykeerthy and Vineeth N Balasubramanian},
journal= {arXiv preprint arXiv:2409.04041},
year = {2024}
}