SceneCOT:在 3D 场景中引导基于感知的链式思考推理
计算机视觉与模式识别
2026-03-06 v3 人工智能
摘要
现有研究在 3D 大型语言模型(LLM)方面仍 struggles 于实现基于感知的问答,主要由于对人类类场景-对象感知推理机制的探索不足。本文通过提出一种新框架来弥合这一差距。我们首先引入一种在 3D 场景中进行基于感知的链式思考推理方法(SCENECOT),将复杂的推理任务分解为更简单可管理的问题,并基于多模态专家模块构建相应的视觉线索。为实现此方法,我们开发了 SCENECOT-185K,即第一个大规模基于感知的链式思考推理数据集,包含 185K 组高质量实例。广泛的实验在各种复杂 3D 场景推理基准上表明,我们的新框架在保持高 grounding-QA 一致性方面取得了强劲性能。据我们所知,这是首次成功地将链式思考推理应用于 3D 场景理解,实现了逐步的人类类推理,并显示出可扩展至更广泛 3D 场景理解场景的潜力。
引用
@article{arxiv.2510.16714,
title = {SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes},
author = {Xiongkun Linghu and Jiangyong Huang and Ziyu Zhu and Baoxiong Jia and Siyuan Huang},
journal= {arXiv preprint arXiv:2510.16714},
year = {2026}
}
备注
Accepted by ICLR 2026. Project page: https://scenecot.github.io/