语义类别规模化:探究视觉Transformer标记性能的影响
计算机视觉与模式识别
2025-03-18 v1 人工智能
机器学习
摘要
本研究探讨了语义类别规模化对视觉Transformer(ViT)图像分类性能的影响。在此特定情况下,使用Jina AI提供的CLIP服务器进行实验。该研究假设,随着ground truth类别和人工引入的语义等价类别数量增加,ViT的标记准确率会提高,直到达到理论最大值或限制。为测试这一假设,选取了多种图像数据集进行实验。这些数据集经过设计为在Python中评估模型准确性的自定义函数处理,以便根据数据集之间的格式差异进行调整。通过指数方式引入新的冗余类别,实验评估了准确率趋势,直到出现平台化、下降或不一致波动。研究结果表明,虽然语义规模化最初会增加模型性能,但在超过关键阈值后,益处会减小或逆转,从而为ViT的类别标记策略提供了洞见,揭示了其局限性及可能的优化方向。
引用
@article{arxiv.2503.12617,
title = {Scaling Semantic Categories: Investigating the Impact on Vision Transformer Labeling Performance},
author = {Anthony Lamelas and Harrison Muchnic},
journal= {arXiv preprint arXiv:2503.12617},
year = {2025}
}
备注
4 pages, 7 figures, submitted to CVPR (feedback pending)