语义残差:多模态统一离散表示
计算机视觉与模式识别
2024-12-30 v1 机器学习
摘要
最近的多模态统一表示研究主要采用码本作为表示形式,利用向量量化(VQ)进行量化,但对其他量化表示形式的探索不足。本文探索更精确的量化方法,引入基于残差向量量化(RVQ)中数值残差概念的新框架——语义残差跨模态信息解�合(SRCID)。SRCID利用语义残差进行信息解�合,以更好地处理不同模态间的内在差异。该方法提升了统一多模态表示的能力,在跨模态泛化和跨模态零样本检索中表现卓越。其平均结果显著优于现有最先进模型,以及基于RVQ和有限标量量化(FSQ)的前期尝试。
引用
@article{arxiv.2412.19128,
title = {Semantic Residual for Multimodal Unified Discrete Representation},
author = {Hai Huang and Shulei Wang and Yan Xia},
journal= {arXiv preprint arXiv:2412.19128},
year = {2024}
}
备注
ICASSP 2025 Accepted