Food-500 Cap:用于评估视觉语言模型的细粒度食物描述基准
计算机视觉与模式识别
2023-08-08 v1 计算与语言
摘要
视觉语言模型(VLMs)在大量下游多模态任务中展现了令人印象深刻的性能。然而,仅比较在下游任务上的微调性能会导致 VLMs 的可解释性差,这不利于其未来改进。若干先前工作已识别出该问题,并在零样本设定下使用多种探测方法来检测 VLMs 的局限性,但它们均使用通用数据集而非专用数据集来考察 VLMs。在实际应用中,VLMs 通常被应用于特定场景,如电商与新闻领域,因此应更多关注 VLMs 在特定领域的泛化能力。在本文中,我们全面考察了流行 VLMs 在特定领域——食物领域——中的能力。为此,我们构建了一个食物描述数据集 Food-500 Cap,包含 24,700 张食物图像,涵盖 494 个类别。每张图像配有详细描述,包括食物的细粒度属性,如食材、形状和颜色。我们还提供了一个烹饪文化分类法,依据地理来源对每个食物类别进行分类,以更好地分析 VLM 在不同地区的性能差异。在我们所提数据集上的实验表明,流行 VLMs 在食物领域的表现相比通用领域更差。此外,我们的研究揭示了 VLMs 在处理来自不同地理区域食物项能力上的严重偏差。我们采用多种探测方法并评估了属于不同架构的九个 VLMs 以验证上述观察。我们希望本研究能引起研究者对 VLM 应用于食物或烹饪文化领域时局限性的关注,并推动进一步研究以解决该问题。
引用
@article{arxiv.2308.03151,
title = {Food-500 Cap: A Fine-Grained Food Caption Benchmark for Evaluating Vision-Language Models},
author = {Zheng Ma and Mianzhi Pan and Wenhan Wu and Kanzhi Cheng and Jianbing Zhang and Shujian Huang and Jiajun Chen},
journal= {arXiv preprint arXiv:2308.03151},
year = {2023}
}
备注
Accepted at ACM Multimedia (ACMMM) 2023