无训练动态感知鸿沟:基于动态多模态空间推理的训练-free 草稿链式思维
人工智能
2025-05-23 v1 计算机视觉与模式识别
摘要
虽然链式思维(CoT)已推动多模态大语言模型(MLLM)中复杂推理任务的进步,但现有方法仍局限于文本或静态视觉领域,在动态空间推理任务中常常表现不佳。为弥合这一差距,我们提出了 GRASSLAND,一个新颖的迷宫导航基准,旨在评估动态空间推理能力。我们的实验表明,将动态视觉草稿叠加在输入图像上,以增强文本推理链的性能,显著优于传统方法,为在演化环境中进行空间推理提供了新见解。为实现这一能力的泛化,我们提出 D2R(Dynamic Draft-Augmented Reasoning),一个无训练框架,可无缝将文本 CoT 与相应的视觉草稿集成到 MLLM 中。广泛的评估表明,D2R 在 diverse 任务上 consistently 提升性能,为动态空间推理确立了稳健的基线,无需模型微调。项目已开源于 https://github.com/Cratileo/D2R。
引用
@article{arxiv.2505.16579,
title = {Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning},
author = {Siqu Ou and Hongcheng Liu and Pingjie Wang and Yusheng Liao and Chuan Xuan and Yanfeng Wang and Yu Wang},
journal= {arXiv preprint arXiv:2505.16579},
year = {2025}
}
备注
19 pages, 8 figures