中文

FysicsWorld:面向任意到任意理解、生成与推理的全模态统一基准

计算机视觉与模式识别 2025-12-16 v1

摘要

尽管多模态大语言模型(MLLM)和新兴的全模态架构取得了快速进展,但当前基准在范围和集成方面仍然有限,存在模态覆盖不完整、交互局限于文本中心输出以及模态之间弱互依性和互补性的问题。为弥补这些差距,我们引入了FysicsWorld,这是第一个支持图像、视频、音频和文本之间双向输入输出的全模态基准,实现了理解、生成与推理的全面任意到任意评估。FysicsWorld涵盖16个主要任务和3268个精选样本,汇集了40多个高质量来源,覆盖了丰富的开放域类别和多样化的问题类型。我们还提出了跨模态互补性筛选(CMCS)策略,并将其集成到系统化的数据构建框架中,以生成用于口语交互和融合依赖的跨模态推理的全模态数据。通过对30多个最先进基线的全面评估,涵盖MLLM、模态特定模型、统一理解-生成模型和全模态语言模型,FysicsWorld揭示了各模型在理解、生成和推理方面的性能差异和局限性。我们的基准为评估和推进下一代全模态架构建立了统一基础和强基线。

关键词

引用

@article{arxiv.2512.12756,
  title  = {FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning},
  author = {Yue Jiang and Dingkang Yang and Minghao Han and Jinghang Han and Zizhi Chen and Yizhou Liu and Mingcheng Li and Peng Zhai and Lihua Zhang},
  journal= {arXiv preprint arXiv:2512.12756},
  year   = {2025}
}

备注

The omni-modal benchmark report from Fysics AI