ByDeWay:基于深度引导的无训练多模态大语言模型提升框架
计算机视觉与模式识别
2025-09-17 v2
摘要
我们提出 ByDeWay,一个无需训练即可提升多模态大语言模型 (MLLM) 性能的框架。ByDeWay 使用一种新颖的提示策略称为分层深度提示 (Layered-Depth-Based Prompting, LDP),在不修改任何模型参数的前提下提高空间推理和定位能力。它利用单目深度估计将场景分割为最近层、中远层和最远层,然后生成区域特定的描述性文字。这些结构化、深度感知的描述被附加到图像-问题提示中,为其提供空间上下文。 This 指导 MLLM 产生更具 grounding 且更少幻觉的响应。该方法轻量、模块化,兼容黑盒 MLLM。在针对幻觉敏感 (POPE) 和推理密集型 (GQA) 基准测试中进行实验后显示,跨多个 MLLM 实现了一致的改进,验证了在零训练设置下深度感知提示的有效性。
引用
@article{arxiv.2507.08679,
title = {ByDeWay: Boost Your multimodal LLM with DEpth prompting in a Training-Free Way},
author = {Rajarshi Roy and Devleena Das and Ankesh Banerjee and Arjya Bhattacharjee and Kousik Dasgupta and Subarna Tripathi},
journal= {arXiv preprint arXiv:2507.08679},
year = {2025}
}