中文

R-Bench: 您的大型多模态模型是否对现实损坏具有鲁棒性?

计算机视觉与模式识别 2024-10-10 v1 多媒体 图像与视频处理

摘要

大型多模态模型(LMM)的卓越性能使其在视觉相关任务中广泛应用。然而,现实世界中的各种损坏意味着图像不像在仿真中那样理想,这给了实际应用 LMM 带来了显著挑战。为此,我们引入 R-Bench,一个聚焦于 LMM **现实鲁棒性** 的基准测试。具体而言,我们:(a) 模型了从用户捕获到 LMM 接收之间的完整链路,包括 33 个损坏维度,按损坏序列包含 7 个步骤,按低层属性分为 7 组;(b) 收集了在损坏前后参考/损坏图像数据集,包含 2,970 对人类标记的问答对;(c) 提出了对绝对/相对鲁棒性的全面评估,并对 20 个主流 LMM 进行基准测试。结果显示,尽管 LMM 能正确处理原始参考图像,但在面对损坏图像时其表现不稳定,人类视觉系统的鲁棒性存在显著差距。我们希望 R-Bench 能激励提高 LMM 的鲁棒性,**将其从实验仿真扩展到现实应用**。详情请访问 https://q-future.github.io/R-Bench。

关键词

引用

@article{arxiv.2410.05474,
  title  = {R-Bench: Are your Large Multimodal Model Robust to Real-world Corruptions?},
  author = {Chunyi Li and Jianbo Zhang and Zicheng Zhang and Haoning Wu and Yuan Tian and Wei Sun and Guo Lu and Xiaohong Liu and Xiongkuo Min and Weisi Lin and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2410.05474},
  year   = {2024}
}