中文

Situat3DChange:面向多模态大语言模型的情境化三维变化理解数据集

计算机视觉与模式识别 2025-10-14 v1

摘要

物理环境和情境本质上是动态的,然而当前的3D数据集和评估基准倾向于孤立地关注动态场景或动态情境,导致理解不完整。为克服这些限制,我们引入了Situat3DChange,这是一个大规模数据集,支持遵循感知-行动模型的三种情境感知变化理解任务:121K个问答对、36K个用于感知任务的变化描述,以及17K个用于行动任务的重排指令。为构建此大规模数据集,Situat3DChange利用11K个人类对环境变化的观察,为人类-AI协作建立共享心智模型和共享情境意识。这些观察结果,辅以自我中心视角和异我中心视角以及类别空间关系和坐标空间关系,通过LLM进行整合,以支持对情境化变化的理解。为应对比较来自同一场景且仅有微小变化的点云对的挑战,我们提出了SCReasoner,一种高效的3D MLLM方法,能够以最小的参数开销且无需为语言解码器增加额外token,实现有效的点云比较。在Situat3DChange任务上的全面评估突显了MLLMs在动态场景和情境理解方面的进展与局限性。关于数据缩放和跨域迁移的额外实验证明了将Situat3DChange作为MLLMs训练数据集的任务无关有效性。

关键词

引用

@article{arxiv.2510.11509,
  title  = {Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model},
  author = {Ruiping Liu and Junwei Zheng and Yufan Chen and Zirui Wang and Kunyu Peng and Kailun Yang and Jiaming Zhang and Marc Pollefeys and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2510.11509},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025 Datasets and Benchmarks Track. Dataset and Code: https://github.com/RuipingL/Situat3DChange