中文

AEGIS:探索统一多模态模型世界知识能力的极限

计算机视觉与模式识别 2026-01-05 v1

摘要

统一多模态模型(UMMs)在跨任务中应用世界知识的能力仍是一个关键且尚未解决的挑战。现有基准不足,仅提供孤立的单任务评估,诊断能力有限。为填补这一差距,我们提出 AEGIS(即 Assess Editing, Generation, Interpretation-Understanding for Super-intelligence),一个涵盖视觉理解、生成、编辑及交叉生成的综合性多任务基准。AEGIS 包含 1050 个具有挑战性的手动标注问题,涵及 21 个主题(包括 STEM、人文、日常生活等)和 6 种推理类型。为具体评估 UMMs 在世界知识范围内的性能而避免模糊指标,进一步提出确定性检查列表评估(DCE)协议,用原子“Y/N”判断取代模糊的基于提示的评分,提高评估可靠性。我们的大规模实验表明,大多数 UMMs 表现出严重的世界知识缺陷,且在复杂推理下性能显著下降。此外,简单的插置式推理模块可部分缓解这些漏洞,为未来研究指明了希望之路。这些结果凸显了以世界知识为基础的推理作为 UMMs 关键前沿的重要性。

关键词

引用

@article{arxiv.2601.00561,
  title  = {AEGIS: Exploring the Limit of World Knowledge Capabilities for Unified Mulitmodal Models},
  author = {Jintao Lin and Bowen Dong and Weikang Shi and Chenyang Lei and Suiyun Zhang and Rui Liu and Xihui Liu},
  journal= {arXiv preprint arXiv:2601.00561},
  year   = {2026}
}