基于多模态数据的高效自我中心动作识别
计算机视觉与模式识别
2025-06-03 v1 人工智能
摘要
可穿戴 XR 设备日益普及,为自我中心动作识别(EAR)系统开辟了新的前景,该系统可提供更深入的人类理解与情境感知。然而,由于便携性、电池续航和计算资源之间固有的权衡,在这些设备上部署实时算法颇具挑战。本文系统分析了不同输入模态(RGB 视频与 3D 手部姿态)的采样频率对自我中心动作识别性能及 CPU 占用率的影响。通过探索一系列配置,我们对准确率与计算效率之间的权衡进行了全面刻画。研究结果表明,降低 RGB 帧的采样率并辅以更高频率的 3D 手部姿态输入,可在显著降低 CPU 需求的同时保持高准确率。值得注意的是,我们观察到 CPU 占用率最多可降低 3 倍,且识别性能几乎没有损失。这凸显了多模态输入策略作为在 XR 设备上实现高效实时 EAR 的可行方法的潜力。
引用
@article{arxiv.2506.01757,
title = {Efficient Egocentric Action Recognition with Multimodal Data},
author = {Marco Calzavara and Ard Kastrati and Matteo Macchini and Dushan Vasilevski and Roger Wattenhofer},
journal= {arXiv preprint arXiv:2506.01757},
year = {2025}
}
备注
Accepted as an extended abstract at the Second Joint Egocentric Vision (EgoVis) Workshop, 2025