中文

用于跨模态检索与活动识别任务的多模态基础模型

计算机视觉与模式识别 2025-06-05 v1 人工智能 机器学习

摘要

近年来,可穿戴设备的广泛采用凸显了使用 IMU 进行行为分析日益增长的重要性。虽然应用涵盖医疗保健和机器人等不同领域,但除了单模态分析外,近期研究越来越关注多模态分析。多项研究提出了结合第一人称视频和文本数据的多模态基础模型;然而,这些模型在对全身人类活动进行详细分析方面仍存在不足。为解决这一局限性,我们提出了活动理解与表示对齐——多模态基础模型(AURA-MFM),这是一个整合了四种模态的基础模型:第三人称视频、动作捕捉、IMU 和文本。通过结合第三人称视频和动作捕捉数据,该模型能够对人类活动进行详细且多维度的理解,而这仅靠第一人称视角是无法捕获的。此外,采用基于 Transformer 的 IMU 编码器来增强模型的整体性能。在检索和活动识别任务上的实验评估表明,我们的模型超越了现有方法。值得注意的是,在动作识别的零样本分类中,我们的方法取得了显著更高的性能,F1 分数为 0.6226,准确率为 0.7320,而现有方法的 F1 分数为 0.0747,准确率为 0.1961。

关键词

引用

@article{arxiv.2506.03174,
  title  = {Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks},
  author = {Koki Matsuishi and Kosuke Ukita and Tsuyoshi Okita},
  journal= {arXiv preprint arXiv:2506.03174},
  year   = {2025}
}

备注

25 pages, 8 figures