中文

语义残差:多模态统一离散表示

计算机视觉与模式识别 2024-12-30 v1 机器学习

摘要

最近的多模态统一表示研究主要采用码本作为表示形式,利用向量量化(VQ)进行量化,但对其他量化表示形式的探索不足。本文探索更精确的量化方法,引入基于残差向量量化(RVQ)中数值残差概念的新框架——语义残差跨模态信息解�合(SRCID)。SRCID利用语义残差进行信息解�合,以更好地处理不同模态间的内在差异。该方法提升了统一多模态表示的能力,在跨模态泛化和跨模态零样本检索中表现卓越。其平均结果显著优于现有最先进模型,以及基于RVQ和有限标量量化(FSQ)的前期尝试。

关键词

引用

@article{arxiv.2412.19128,
  title  = {Semantic Residual for Multimodal Unified Discrete Representation},
  author = {Hai Huang and Shulei Wang and Yan Xia},
  journal= {arXiv preprint arXiv:2412.19128},
  year   = {2024}
}

备注

ICASSP 2025 Accepted