X-Fi:一种多模态人类感知的模态无关基础模型
计算机视觉与模式识别
2025-02-18 v3 信号处理
摘要
人类感知运用了各种传感器和先进的深度学习技术,旨在准确捕获和解释人体信息,已显著影响公共安全和机器人等领域。然而,当前的人类感知主要依赖相机和 LiDAR 等模态,每种模态各有优势与局限。此外,现有的多模态融合解决方案通常针对固定的模态组合进行设计,在模态添加或移除以适应多样化场景时需要大量重新训练。本文提出一种面向所有模态的模态无关基础模型,即 X-Fi,以解决此问题。X-Fi 通过 transformer 结构适应可变输入大小,并纳入 novel “X-fusion” 机制,以在多模态集成期间保留模态特定特征。该方法不仅提升了适应性,也促进了跨模态互补特征的学习。在 MM-Fi 和 XRF55 数据集上进行了广泛实验,包含六种不同模态,结果表明 X-Fi 在人体姿态估计 (HPE) 和人体活动识别 (HAR) 任务中实现了最先进的性能。我们的发现表明,所提出的模型能够高效支持广泛的人类感知应用,最终推动了可扩展多模态感知技术的演进。
关键词
引用
@article{arxiv.2410.10167,
title = {X-Fi: A Modality-Invariant Foundation Model for Multimodal Human Sensing},
author = {Xinyan Chen and Jianfei Yang},
journal= {arXiv preprint arXiv:2410.10167},
year = {2025}
}