视觉字典中的语义多样性与视觉多样性比较
计算机视觉与模式识别
2015-11-23 v1
摘要
视觉字典是基于视觉词袋(BoVW)模型的图像分类/检索系统的关键组件。字典通常从未经监督的训练集(从目标图像集合中采样)中学习得到。然而,对于大型、通用、动态的图像集合(例如网络),在语义概念方面获得具有代表性的样本并非易事。本文中,我们评估语义对字典质量的影响,旨在验证对于视觉字典而言语义多样性相对于视觉多样性的重要性。在实验中,我们改变用于创建字典的类别数量,然后使用多种码本尺寸以及不同的编码与池化方法(标准BoVW和Fisher Vectors)计算不同的BoVW描述子。图像分类的结果表明,由于视觉字典基于低级视觉外观,视觉多样性比语义多样性更为重要。我们的结论为减轻生成视觉字典的负担提供了机会,因为仅需一组视觉多样的图像而非整个集合即可创建良好的字典。
引用
@article{arxiv.1511.06704,
title = {Semantic Diversity versus Visual Diversity in Visual Dictionaries},
author = {Otávio A. B. Penatti and Sandra Avila and Eduardo Valle and Ricardo da S. Torres},
journal= {arXiv preprint arXiv:1511.06704},
year = {2015}
}