针对常见损坏的大型多模态模型基准测试
机器学习
2024-01-23 v1 计算与语言
密码学与安全
计算机视觉与模式识别
多媒体
摘要
本技术报告旨在填补大型多模态模型(LMM)评估中的不足,专门考察其输出在遭受常见损坏时的自一致性。我们研究了文本、图像和语音之间的跨模态交互,涵盖了四个基本生成任务:文本到图像、图像到文本、文本到语音和语音到文本。我们创建了一个名为MMCBench的综合基准,涵盖100多个流行的LMM(总计超过150个模型检查点)。在常见损坏下的全面评估对于实际部署至关重要,并有助于更好地理解前沿LMM的可靠性。基准测试代码可在https://github.com/sail-sg/MMCBench获取。
引用
@article{arxiv.2401.11943,
title = {Benchmarking Large Multimodal Models against Common Corruptions},
author = {Jiawei Zhang and Tianyu Pang and Chao Du and Yi Ren and Bo Li and Min Lin},
journal= {arXiv preprint arXiv:2401.11943},
year = {2024}
}
备注
Technical report