超越链条思考:作为生成式多模态嵌入的重写
计算机视觉与模式识别
2026-05-29 v2
摘要
多模态大语言模型(MLLMs)已成为通用多模态嵌入的有前景的基础。最近的研究表明,基于推理的生成式多模态嵌入在多个嵌入任务上优于判别式嵌入。然而,链式思考(CoT)推理倾向于生成冗余的思考步骤,并在更广泛的检索场景中引入答案总结的语义模糊性。为克服此限制,我们提出 Rewrite-driven Multimodal Embedding(RIME),一个通过检索友好型重写联合优化生成和嵌入的统一框架。同时,我们提出 Cross-Mode Alignment(CMA)以桥接生成式和判别式嵌入空间,实现灵活的相互检索以在效率和准确性之间进行权衡。基于此,我们还引入 Refine Reinforcement Learning(Refine-RL),将判别式嵌入作为稳定语义锚点以指导重写优化。基于 MMEB-V2、MRMR 和 UVRB 的大量实验表明,RIME 在超越先前生成式嵌入模型的同时,显著减少了思考的长度。
引用
@article{arxiv.2604.22280,
title = {Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings},
author = {Peixi Wu and Ke Mei and Feipeng Ma and Bosong Chai and Zhibin Lan and Chenxi Zhao and Shannan Yan and Jie Chen and Zhangchi Hu and Yansong Peng and Bo Lin and Junjie Zhou and Dacheng Yin and Tianyi Wang and Fengyun Rao and Jing Lyu and Hebei Li and Xiaoyan Sun},
journal= {arXiv preprint arXiv:2604.22280},
year = {2026}
}