中文

从宏观到微观:基于视觉语言模型的分子微观空间智能基准测试

计算机视觉与模式识别 2025-12-15 v2

摘要

本文引入了微观空间智能(Microscopic Spatial Intelligence, MiSI)的概念,这是一种感知和推理看不见的微观实体之间空间关系的能力,这是科学发现的基本能力。为评估视觉语言模型(Vision-Language Models, VLMs)在该领域的潜力,我们提出了一套系统性的基准框架MiSI-Bench。该框架包含超过163,000个问答对和587,000张图像,来自约4,000个分子结构,涵盖九个互补任务,评估从基础空间变换到复杂关系识别的能力。实验结果表明,当前领先的视觉语言模型在该基准测试中表现显著低于人类水平。然而,一个微调过的7B模型在空间变换任务中展现出巨大的潜力,甚至超过了人类,而其在氢键识别等基于科学的任务中的表现较差,凸显了在通往科学通用人工智能的道路上,整合显式领域知识的必要性。该数据集可在 https://huggingface.co/datasets/zongzhao/MiSI-bench 获取。

关键词

引用

@article{arxiv.2512.10867,
  title  = {From Macro to Micro: Benchmarking Microscopic Spatial Intelligence on Molecules via Vision-Language Models},
  author = {Zongzhao Li and Xiangzhe Kong and Jiahui Su and Zongyang Ma and Mingze Li and Songyou Li and Yuelin Zhang and Yu Rong and Tingyang Xu and Deli Zhao and Wenbing Huang},
  journal= {arXiv preprint arXiv:2512.10867},
  year   = {2025}
}