中文

CausalEmbed:隐空间中自回归多向量生成用于视觉文档嵌入

计算与语言 2026-04-17 v3

摘要

尽管多模态大语言模型(MLLMs)通过生成高质量多向量嵌入在视觉文档检索(VDR)中展现出显著潜力,但以数千个视觉token表示一页内容所带来的巨大存储开销限制了其在实际应用中的可行性。为应对这一挑战,我们提出了一种自回归生成方法CausalEmbed,用于构建多向量嵌入。通过在对比学习过程中引入迭代间隔损失,CausalEmbed鼓励嵌入模型学习紧凑且结构良好的表示。我们的方法仅需数十个视觉token即可高效执行VDR任务,在token数量上实现30–155倍的缩减,同时在各种骨干网络和基准测试上保持极具竞争力的性能。理论分析与实证结果表明,自回归嵌入生成在训练效率和测试时扩展性方面具有独特优势。因此,CausalEmbed为多向量VDR表示引入了灵活的测试时扩展策略,并为多模态文档检索中的生成范式提供了启示。我们的代码可在 https://github.com/Z1zs/Causal-Embed 获取。

关键词

引用

@article{arxiv.2601.21262,
  title  = {CausalEmbed: Auto-Regressive Multi-Vector Generation in Latent Space for Visual Document Embedding},
  author = {Jiahao Huo and Yu Huang and Yibo Yan and Ye Pan and Kening Zheng and Wei-Chieh Huang and Yi Cao and Mingdong Ou and Philip S. Yu and Xuming Hu},
  journal= {arXiv preprint arXiv:2601.21262},
  year   = {2026}
}

备注

Under review