中文

Waste-Bench:面向杂乱环境中评估VLLMs的综合基准

计算机视觉与模式识别 2025-09-03 v1 人工智能

摘要

大型语言模型(LLMs)的最新进展为视觉大型语言模型(VLLMs)铺平了道路,使其能够执行广泛的视觉理解任务。尽管 LLMs 在标准自然图像上表现出色,但在包含形状不规则物体的复杂数据集等杂乱环境中,其能力尚未得到充分探索。在本研究中,我们引入了一个专门为真实世界场景中的废物分类设计的新数据集,其特点是环境复杂且物体形状不规则。伴随该数据集,我们提出了一种深入的评估方法,以严格评估 VLLMs 的鲁棒性和准确性。所引入的数据集和综合分析为 VLLMs 在挑战性条件下的表现提供了有价值的见解。我们的发现强调了进一步提升 VLLM 鲁棒性以在复杂环境中更好表现的迫切需求。我们实验的数据集和代码将公开发布。

关键词

引用

@article{arxiv.2509.00176,
  title  = {Waste-Bench: A Comprehensive Benchmark for Evaluating VLLMs in Cluttered Environments},
  author = {Muhammad Ali and Salman Khan},
  journal= {arXiv preprint arXiv:2509.00176},
  year   = {2025}
}