多维度洞察:大型多模态模型在真实世界个性化中的基准测试
人工智能
2024-12-18 v1 计算与语言
计算机视觉与模式识别
摘要
快速发展的Large Multimodal Models (LMMs)领域催生了多种具有卓越能力的模型。然而,现有的基准测试无法全面、客观和准确地评估LMMs是否契合真实场景中人类的多样化需求。为弥补这一差距,我们提出了多维度洞察(MDI)基准测试,其中包含超过500张涵盖人类生活六个常见场景的图像。值得注意的是,MDI-Benchmark相比现有评估具有两大显著优势:(1)每张图像均配有两种类型的问题:用于评估模型对图像理解程度的简单问题,以及用于评估模型超越基本内容的分析与推理能力的复杂问题。(2)考虑到不同年龄段人群在面对同一场景时具有不同的需求和视角,我们的基准测试将问题划分为三个年龄类别:青年、中年和老年。该设计允许详细评估LMMs在满足不同年龄群体偏好和需求方面的能力。在MDI-Benchmark上,像GPT-4o这样的强大模型在与年龄相关的任务上达到了79%的准确率,这表明现有的LMMs在处理真实世界应用方面仍有很大的提升空间。展望未来,我们期望MDI-Benchmark将为LMMs在真实世界个性化对齐方面开辟新途径。MDI-Benchmark数据和评估代码可在 https://mdi-benchmark.github.io/ 获取。
引用
@article{arxiv.2412.12606,
title = {Multi-Dimensional Insights: Benchmarking Real-World Personalization in Large Multimodal Models},
author = {YiFan Zhang and Shanglin Lei and Runqi Qiao and Zhuoma GongQue and Xiaoshuai Song and Guanting Dong and Qiuna Tan and Zhe Wei and Peiqing Yang and Ye Tian and Yadong Xue and Xiaofei Wang and Honggang Zhang},
journal= {arXiv preprint arXiv:2412.12606},
year = {2024}
}
备注
33 pages, 33 figures, Work in progress