中文

针对常见损坏的大型多模态模型基准测试

机器学习 2024-01-23 v1 计算与语言 密码学与安全 计算机视觉与模式识别 多媒体

摘要

本技术报告旨在填补大型多模态模型(LMM)评估中的不足,专门考察其输出在遭受常见损坏时的自一致性。我们研究了文本、图像和语音之间的跨模态交互,涵盖了四个基本生成任务:文本到图像、图像到文本、文本到语音和语音到文本。我们创建了一个名为MMCBench的综合基准,涵盖100多个流行的LMM(总计超过150个模型检查点)。在常见损坏下的全面评估对于实际部署至关重要,并有助于更好地理解前沿LMM的可靠性。基准测试代码可在https://github.com/sail-sg/MMCBench获取。

关键词

引用

@article{arxiv.2401.11943,
  title  = {Benchmarking Large Multimodal Models against Common Corruptions},
  author = {Jiawei Zhang and Tianyu Pang and Chao Du and Yi Ren and Bo Li and Min Lin},
  journal= {arXiv preprint arXiv:2401.11943},
  year   = {2024}
}

备注

Technical report