通过结构方程模型将 MLLM 基准对齐人类偏好
计算与语言
2025-11-14 v2
摘要
评估多模态大语言模型(MLLM)面临核心挑战:缺乏结构化、可解释且具理论依据的基准测试;现有基于启发式分组的任务认知目标模糊、能力交叉、指标冗余且诊断能力弱。为此,我们提出一种基于结构方程模型(SEM)对齐的框架,量化衡量内部效度、维度可分离性和组成要素贡献,同时引入一种以皮亚格(Piaget)为灵感的能力层级结构,将 MLLM 能力划分为感知、记忆与推理三个层级。将现有任务在该理论框架下重新组织后,我们构建了 GOLD 基准测试,实验结果显示其在可解释性、指标冗余度和认知一致性方面均优于先前基准。
引用
@article{arxiv.2506.21572,
title = {Aligning MLLM Benchmark With Human Preferences via Structural Equation Modeling},
author = {Shengwu. Xiong and Tianyu. Zou and Cong. Wang and Xuelong Li},
journal= {arXiv preprint arXiv:2506.21572},
year = {2025}
}
备注
12 pages, 9 figures