HumaniBench:面向大型多模态模型的人类中心评估框架
计算机视觉与模式识别
2025-12-01 v6 人工智能
摘要
尽管近期大型多模态模型(LMM)在视觉语言任务上展现出惊人的进步,但其与人类中心(HC)原则(如公平性、伦理、包容性、共情和鲁棒性)的对齐程度仍不为人知。我们提出 HumaniBench,一个统一的评估框架,旨在刻画 HC 对齐在真实、社会导向的视觉情境中的表现。HumaniBench 包含 32,000 条经专家验证的图像-问题对,来自真实世界的新闻图像,并涵盖七个评估任务:场景理解、实例身份识别、多选式视觉问答(VQA)、多语言性、视觉定位、共情式描述和图像鲁棒性测试。每个任务映射到一个或多个 HC 原则,通过原则化的指标衡量,涵盖准确性、有害内容检测、幻觉和忠实度、连贯性、跨语言质量、共情和鲁棒性。我们评估了 15 个最先进的 LMM,发现各模型在 HC 维度上存在持续的权衡:专有系统在伦理、推理和共情方面表现最佳,而开源模型在视觉定位和鲁棒性方面更优。所有模型都在公平性和多语言包容性方面存在持久的差距。我们进一步分析了推理时技术的影响,发现链式思考提示和测试时扩缩可在多个 HC 维度上带来 8-12% 的提升。HumaniBench 提供了一个可复现、可扩展的体系,为 LMM 的系统 HC 评估奠定了基础,使我们能够对传统多模态基准测试所捕获不到的对齐权衡进行细粒度分析。https://vectorinstitute.github.io/humanibench/
引用
@article{arxiv.2505.11454,
title = {HumaniBench: A Human-Centric Framework for Large Multimodal Models Evaluation},
author = {Shaina Raza and Aravind Narayanan and Vahid Reza Khazaie and Ashmal Vayani and Ahmed Y. Radwan and Mukund S. Chettiar and Amandeep Singh and Mubarak Shah and Deval Pandya},
journal= {arXiv preprint arXiv:2505.11454},
year = {2025}
}