重新思考开放词汇分割的评估指标
计算机视觉与模式识别
2023-11-07 v1
摘要
在本文中,我们指出开放词汇分割中所采用的评估指标存在的一个问题:评估过程仍严重依赖闭集指标,在零样本或跨数据集流程中未考虑预测类别与真实类别之间的相似性。为解决此问题,我们首先通过全面的定量分析与用户研究,利用WordNet语言统计、文本嵌入和语言模型,调研了两种类别词之间的十一种相似性度量。基于这些探索出的度量,我们设计了新颖的评估指标,即Open mIoU、Open AP和Open PQ,专为三种开放词汇分割任务定制。我们在三种分割任务的12种开放词汇方法上对所提评估指标进行了基准测试。尽管相似性距离存在主观性,我们证明我们的指标仍能很好地评估现有开放词汇分割方法的开放能力。我们希望我们的工作能为社区带来关于如何评估模型开放能力的新思考。评估代码已发布于github。
引用
@article{arxiv.2311.03352,
title = {Rethinking Evaluation Metrics of Open-Vocabulary Segmentaion},
author = {Hao Zhou and Tiancheng Shen and Xu Yang and Hai Huang and Xiangtai Li and Lu Qi and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2311.03352},
year = {2023}
}