在真实场景中学习预测视觉属性
计算机视觉与模式识别
2021-06-18 v1
摘要
视觉属性构成了场景中所包含信息的很大一部分。物体可以用描绘其视觉外观(颜色、纹理)、几何(形状、尺寸、姿态)以及其他内在属性(状态、动作)的多种多样的属性来描述。现有工作大多局限于特定领域中属性预测的研究。在本文中,我们引入了一个大规模真实场景视觉属性预测数据集,包含超过 26 万个物体实例的逾 92.7 万条属性标注。形式上,物体属性预测是一个多标签分类问题,必须预测适用于某物体的所有属性。由于属性数量大、标签稀疏、数据不平衡以及物体遮挡,我们的数据集对现有方法提出了重大挑战。为此,我们提出了若干系统性应对这些挑战的技术,包括一个利用低层与高层 CNN 特征及多跳注意力的基础模型、重加权与重采样技术、一种新颖的负标签扩展方案,以及一种新颖的监督属性感知对比学习算法。利用这些技术,我们相比当前最先进水平取得了近 3.7 mAP 和 5.7 总体 F1 点的提升。关于 VAW 数据集的更多细节可在 http://vawdataset.com/ 找到。
引用
@article{arxiv.2106.09707,
title = {Learning to Predict Visual Attributes in the Wild},
author = {Khoi Pham and Kushal Kafle and Zhe Lin and Zhihong Ding and Scott Cohen and Quan Tran and Abhinav Shrivastava},
journal= {arXiv preprint arXiv:2106.09707},
year = {2021}
}
备注
Accepted to CVPR 2021