大型人工智能模型时代的多模态基准测试综述
人工智能
2024-09-30 v1 多媒体
摘要
多模态大型语言模型(MLLMs)的快速发展为人工智能领域带来了显著进展,显著提升了理解和生成多模态内容的能力。虽然已有研究主要集中在模型架构和训练方法上,但对用于评估这些模型的基准测试进行系统性分析仍显不足。本综述通过系统性审查 211 个评估 MLLMs 的基准测试来弥补这一空白,涵盖理解、推理、生成和应用四个核心领域。我们对各种模态下的任务设计、评估指标和数据集构建进行了详细分析。我们希望本综述通过提供基准测试实践的全面概览,为 MLLM 研究的持续进步作出贡献,并指明未来工作的有前景的方向。此外,还有一个收录最新论文的 GitHub 仓库。
引用
@article{arxiv.2409.18142,
title = {A Survey on Multimodal Benchmarks: In the Era of Large AI Models},
author = {Lin Li and Guikun Chen and Hanrong Shi and Jun Xiao and Long Chen},
journal= {arXiv preprint arXiv:2409.18142},
year = {2024}
}
备注
Ongoing project