按需思考:基于自适应推理与双LoRA架构的多模态嵌入
计算机视觉与模式识别
2026-05-15 v1 计算与语言
信息检索
摘要
多模态大语言模型(MLLMs)已成为多模态嵌入的强大主干。最近的方法将思维链(CoT)推理引入嵌入流水线以提高检索质量,但在模型大小和推理成本上仍然昂贵。它们通常采用独立的推理器和嵌入器,具有大量的参数开销,并对每个输入不加区分地生成CoT。然而,我们观察到,对于简单输入,判别式嵌入已经表现良好,而冗余的推理甚至会误导模型,降低性能。为了解决这些限制,我们提出了Think When Needed(TWN),一个具有自适应推理的统一多模态嵌入框架。TWN引入了双LoRA架构,将推理和嵌入适配器附加到一个共享的冻结主干上,在其接口处分离梯度以缓解联合优化引入的梯度冲突,同时使参数保持接近单一模型。在此基础上,自适应思考机制使用自监督路由门来针对每个输入决定是否生成CoT,跳过不必要的推理以减少推理开销,甚至提高检索质量。我们进一步探索了嵌入引导的强化学习,以在监督训练之外优化CoT质量。在MMEB-V2的78个任务上,TWN实现了最先进的嵌入质量,同时比现有生成方法效率显著更高,相对于主干仅需3-5%的额外参数,且与完全生成模式相比,推理token最多减少50%。
引用
@article{arxiv.2605.14448,
title = {Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture},
author = {Longxiang Zhang and Weilong Dai and Guanghao Zhang and Hao Jiang and Pipei Huang},
journal= {arXiv preprint arXiv:2605.14448},
year = {2026}
}
备注
30 pages, preprint