TTE-Flash:通过思考-然后-嵌入标记加速基于推理的多模态表示
人工智能
2026-05-19 v1
摘要
近期研究表明,通用多模态嵌入(UME)从链式思考(CoT)推理中获益显著。在此范式下,生成式模型为多模态查询生成显式的推理轨迹,最终表示从 <eos> 嵌入标记注意力地查询和推理。尽管有效,但生成显式 CoT 轨迹的计算开销往往不可接受。本文提出用潜在思考标记取代显式 CoT,这些标记被解释为可以产生显式 CoT 轨迹的潜在变量。通过使用 CoT 生成损失优化思考标记,再通过对比损失优化嵌入标记,我们产生在常数推理成本下的高性能、推理感知表示。我们的研究检验了两个关键架构设计:1)思考标记和嵌入标记如何从相同的 LLM 主干中提取;2)这些标记如何作为两个相互依赖的任务进行训练。我们引入 TTE-Flash-2B,一个推理感知的多模态表示模型,其在 MMEB-v2 基准测试上优于显式 CoT 框架,同时产生可文本和可视化解释的潜在思考标记。此外,跨 15 个视频数据集的零样态评估揭示了随思考标记数量增加而出现的尺度行为,并启发了基于任务需求的自适应思考预算分配的 pilot 研究。
引用
@article{arxiv.2605.16638,
title = {TTE-Flash: Accelerating Reasoning-based Multimodal Representations via Think-Then-Embed Tokens},
author = {Jianpeng Cheng and Xian Wu and Jiangfan Zhang and Wentao Bao and Chaitanya Ahuja and Shlok Kumar Mishra and Hanchao Yu and Yang Gao and Fan Xia and Qi Guo and Shaodan Zhai and Xiangjun Fan and Jun Xiao},
journal= {arXiv preprint arXiv:2605.16638},
year = {2026}
}