中文

Any2Any: 基于共形预测的不完整多模态检索

计算机视觉与模式识别 2024-11-27 v2 信息检索 多媒体

摘要

自主智能体通过整合视觉、音频和激光雷达等多模态输入来感知和解释周围环境。这些感知模态支持检索任务,例如机器人中的场所识别。然而,当因传感器故障或不可访问导致部分数据缺失(如无声视频或缺乏 RGB 信息的激光雷达扫描)时,当前的多模态检索系统会遇到困难。我们提出了 Any2Any——一种新颖的检索框架,旨在解决查询和参考实例均存在不完整模态的场景。与仅限于两种模态插补的先前方法不同,Any2Any 无需训练生成模型即可处理任意数量的模态。它利用跨模态编码器计算成对相似度,并采用两阶段校准过程结合共形预测来对齐相似度。Any2Any 实现了跨多模态数据集的有效检索,例如文本-激光雷达和文本-时间序列。在 KITTI 数据集上,其 Recall@5 达到 35%,与拥有完整模态的基线模型持平。

关键词

引用

@article{arxiv.2411.10513,
  title  = {Any2Any: Incomplete Multimodal Retrieval with Conformal Prediction},
  author = {Po-han Li and Yunhao Yang and Mohammad Omama and Sandeep Chinchali and Ufuk Topcu},
  journal= {arXiv preprint arXiv:2411.10513},
  year   = {2024}
}