阐释图像到集合预测:模型、损失与数据集分析
计算机视觉与模式识别
2020-05-28 v2
摘要
在本文中,我们指出了图像到集合预测文献中一个重要的可复现性挑战,该挑战阻碍了已发表方法之间的正确比较,即研究人员使用不同的评估协议来评估其贡献。为了缓解这一问题,我们引入了一个图像到集合预测基准套件,该套件建立在五个任务复杂度递增的公开数据集之上,适用于多标签分类(VOC、COCO、NUS-WIDE、ADE20k 和 Recipe1M)。利用该基准,我们提供了深入的分析,研究了当前模型的关键组件,即图像表示骨干网络的选择以及集合预测器的设计。我们的结果表明:(1)利用更好的图像表示骨干网络比增强集合预测器带来更大的性能提升;(2)对标签共现和顺序进行建模在性能方面有轻微的正面影响,而显式基数预测仅在 Recipe1M 等复杂数据集上训练时才有帮助。为了促进未来的图像到集合预测研究,我们在以下地址公开了代码、最佳模型和数据集划分:https://github.com/facebookresearch/image-to-set。
引用
@article{arxiv.1904.05709,
title = {Elucidating image-to-set prediction: An analysis of models, losses and datasets},
author = {Luis Pineda and Amaia Salvador and Michal Drozdzal and Adriana Romero},
journal= {arXiv preprint arXiv:1904.05709},
year = {2020}
}