中文

大型多模态模型中创造性物理智能的进阶

人工智能 2026-05-27 v1 计算与语言 机器学习

摘要

大型多模态模型(LMM)在感知和推理方面取得了快速进展,但是否能够在开放式环境中发现基于视觉的解决方案,超越模式识别,仍不清楚。在此类环境中,智力需要超越回答明确问题:它涉及如何以非显而然但又物理可行的方式复用场景中元素。这种创造性问题解决是人类智力的核心,但在当前基准测试中仍鲜有考察。为评估这种能力,我们引入 MM-CreativityBench,这是一个面向功能-导向创意工具使用的基准测试,适用于视觉丰富、物理受限的环境。每个实例都呈现一个场景图像,包含候选实体及其部件的结构化视图,使我们能够对模型如何迭代检查场景、识别相关功能以及组合视觉和物理可行解决方案进行细粒度、交互式评估。我们的实验表明,当前 LMM 往往不足之处并非来自生成能力,而是因为它们无法维持基于功能的探索。模型常常忽略相关实体、 insufficiently 检查关键部件,或对图像中不存在的属性进行幻觉。受此启发,我们提出了基于功能的对齐方法,将创意工具使用视为一种偏好学习问题。通过 Direct Preference Optimization,我们鼓励模型优先选择基于视觉证据的属性-功能推理,而非幻觉替代方案。此外,我们还整合了来自功能知识库的监督信息,以指导更广泛的实体探索和多轮计划。我们的结果表明,在正确实体和部件的选择方面取得了一致的提升,显著减少了幻觉和与基于功能相关的错误。

关键词

引用

@article{arxiv.2605.26396,
  title  = {Advancing Creative Physical Intelligence in Large Multimodal Models},
  author = {Cheng Qian and Hyeonjeong Ha and Jiayu Liu and Jeonghwan Kim and Emre Can Acikgoz and Bingxuan Li and Kunlun Zhu and Jiateng Liu and Aditi Tiwari and Zhenhailong Wang and Xiusi Chen and Mahdi Namazifar and Heng Ji},
  journal= {arXiv preprint arXiv:2605.26396},
  year   = {2026}
}

备注

51 Pages, 9 Figures, 7 Tables, Previous Work CreativityBench: arXiv:2605.02910