ImageSubject:用于主体检测的大规模数据集
计算机视觉与模式识别
2022-09-16 v2
摘要
主体通常存在于图像或视频中,因为它们是拍摄者想要突出的对象。人类观看者可以轻易识别它们,但算法常将其与其他对象混淆。检测主体是一项重要技术,可帮助机器理解图像和视频的内容。我们提出了一个新数据集,旨在训练模型理解对象的布局和图像的上下文,进而从中找出主体。这通过三个方面实现。通过收集由具备专业拍摄技巧的导演创作的电影镜头图像,我们收集了具有强多样性的数据集,具体而言,它包含来自 21\,540 个电影镜头的 107\,700 张图像。我们为其标注了两个类别的边界框标签:主体与非主体前景对象。我们对该数据集进行了详细分析,并将此任务与显著性检测和对象检测进行比较。ImageSubject 是首个尝试定位拍摄者想要突出的图像中主体的数据集。此外,我们发现基于 transformer 的检测模型在其他流行模型架构中提供了最佳结果。最后,我们讨论了潜在应用,并总结该数据集的重要性。
引用
@article{arxiv.2201.03101,
title = {ImageSubject: A Large-scale Dataset for Subject Detection},
author = {Xin Miao and Jiayi Liu and Huayan Wang and Jun Fu},
journal= {arXiv preprint arXiv:2201.03101},
year = {2022}
}