NUMINA:面向多维智能与数值推理能力的自然理解基准
人工智能
2026-01-29 v2
摘要
二维多模态大语言模型(MLLM)的最新进展显著提升了其在视觉-语言任务中的性能。然而,由于空间推理的复杂性,将这些能力扩展到三维环境仍然是一个独特的挑战。此外,现有的三维基准通常缺乏细粒度的数值推理任务标注,这限制了MLLM执行精确空间测量和复杂数值推理的能力。为弥补这一差距,我们引入了NUMINA,这是首个旨在增强多模态室内感知理解的自然理解基准,用于评估多维智能与数值推理能力。NUMINA具有多尺度标注和多种问答对,这些内容通过NUMINA-Flow生成,这是一个集成了大语言模型(LLM)重写和基于规则的自我验证的自动化标注流程。我们在Chat-Scene框架下评估了各种最先进的LLM在NUMINA上的性能,结果表明,当前的LLM在多模态数值推理方面存在困难,尤其是在执行距离和体积估计等精确计算时,这突显了三维模型进一步发展的必要性。数据集和源代码可从https://github.com/fengshun124/NUMINA获取。
引用
@article{arxiv.2509.16656,
title = {NUMINA: A Natural Understanding Benchmark for Multi-dimensional Intelligence and Numerical Reasoning Abilities},
author = {Changyu Zeng and Yifan Wang and Zimu Wang and Wei Wang and Zhengni Yang and Muyi Bao and Jiming Xiao and Anh Nguyen and Yutao Yue},
journal= {arXiv preprint arXiv:2509.16656},
year = {2026}
}