中文

一种用于评估视觉问答难度的熵聚类方法

计算机视觉与模式识别 2022-09-05 v3

摘要

我们提出了一种无需对难度进行直接监督或标注即可识别视觉问答(VQA)中视觉问题难度的新方法。先前工作考虑了人类标注者真值答案的多样性。相反,我们基于多个不同 VQA 模型的行为来分析视觉问题的难度。我们提出对由三种不同模型获得的预测答案分布的熵值进行聚类:一个以图像和问题为输入的基线方法,以及两个仅以图像为输入和仅以问题为输入变体。我们使用简单的 k-means 对 VQA v2 验证集的视觉问题进行聚类。然后我们使用最先进的方法来确定每个聚类的准确率与答案分布的熵。所提方法的一个好处是不需要对难度进行标注,因为每个聚类的准确率反映了属于它的视觉问题的难度。我们的方法能够识别出最先进方法未能正确回答的困难视觉问题聚类。对 VQA v2 数据集的详细分析表明:1)所有方法在最困难聚类上表现都很差(约 10% 准确率);2)随着聚类难度增加,不同方法预测的答案为开始不同;3)聚类熵值与聚类准确率高度相关。我们展示了我们的方法具有无需真值(即 VQA v2 的测试集)即可通过将视觉问题分配到某一聚类来评估其难度的优势。我们期望这能激发新的研究方向和新型算法的发展。

关键词

引用

@article{arxiv.2004.05595,
  title  = {An Entropy Clustering Approach for Assessing Visual Question Difficulty},
  author = {Kento Terao and Toru Tamaki and Bisser Raytchev and Kazufumi Kaneda and Shun'ichi Satoh},
  journal= {arXiv preprint arXiv:2004.05595},
  year   = {2022}
}