Turath-150K:阿拉伯遗产图像数据库
计算机视觉与模式识别
2022-01-04 v1
摘要
大规模图像数据库仍然严重偏向少数几种文化中所遇到的物体与活动。这种文化多样性图像的缺失——我们称之为隐藏的长尾——限制了预训练神经网络的适用性,并无意中排除了来自代表性不足地区的研究者。为开始补救此问题,我们整理了Turath-150K,一个反映阿拉伯世界常见物体、活动与场景的图像数据库。在此过程中,我们引入了三个基准数据库:Turath Standard、Art与UNESCO,它们是Turath数据集的专门子集。在展示了在ImageNet上预训练的现有网络部署于此类基准时的局限性后,我们训练并评估了若干网络在图像分类任务上的表现。作为Turath的成果,我们希望吸引代表性不足地区的机器学习研究者,并激励发布更多聚焦文化的数据库。该数据库可在此访问:danikiyasseh.github.io/Turath。
引用
@article{arxiv.2201.00220,
title = {Turath-150K: Image Database of Arab Heritage},
author = {Dani Kiyasseh and Rasheed El-Bouri},
journal= {arXiv preprint arXiv:2201.00220},
year = {2022}
}