衡量统一多模态模型中理解与生成能力之间的差距
计算与语言
2026-02-03 v1
摘要
近期进展表明,统一多模态模型(UMM)在理解和生成任务方面取得了显著进展。然而,这两种能力是否在单个模型中真正实现了对齐和集成仍不明确。为探究这一问题,我们引入了GapEval——一个双向基准,用于量化理解与生成能力之间的差距,并定量测量两种“unified”方向的认知一致性。每个问题都可以以两种模态(图像和文本)作答,实现对模型双向推理能力和跨模态一致性的对称评估。实验结果显示,在广泛的不同架构的UMM中,两种方向之间存在持续的差距,表明当前模型仅实现了表层级的统一,而非两种能力的深度认知收敛。为进一步探讨其背后机制,我们从知识操作的视角进行了实证研究,以阐明其局限性。我们的发现表明,UMM中的知识往往是分离的,能力的出现和跨模态知识是不同步的,这为进一步的探索指明了方向。
引用
@article{arxiv.2602.02140,
title = {Quantifying the Gap between Understanding and Generation within Unified Multimodal Models},
author = {Chenlong Wang and Yuhang Chen and Zhihan Hu and Dongping Chen and Wenhu Chen and Sarah Wiegreffe and Tianyi Zhou},
journal= {arXiv preprint arXiv:2602.02140},
year = {2026}
}