从潜在空间到引擎流形:分析 ImageBind 的多模态嵌入空间
计算机视觉与模式识别
2024-09-18 v1 人工智能
摘要
本研究调查了 ImageBind 为在线汽车零部件列表生成有意义的融合多模态嵌入的能力。我们提出了一种简单的嵌入融合工作流,旨在捕获图像/文本对的重叠信息,最终将帖子的语义组合成联合嵌入。将此类融合嵌入存储在向量数据库中后,我们实验了降维,并通过聚类和检查最接近每个聚类中心的帖子,提供了传达联合嵌入语义质量的经验证据。此外,我们利用 ImageBind 涌现的零样本跨模态检索的初步发现表明,纯音频嵌入可以与语义相似的市场列表相关联,指出了未来研究的潜在途径。
引用
@article{arxiv.2409.10528,
title = {From Latent to Engine Manifolds: Analyzing ImageBind's Multimodal Embedding Space},
author = {Andrew Hamara and Pablo Rivas},
journal= {arXiv preprint arXiv:2409.10528},
year = {2024}
}
备注
The 26th International Conference on Artificial Intelligence (ICAI'24)