SigFormer:用于多模态人体动作分割的稀疏信号引导Transformer
计算机视觉与模式识别
2024-08-27 v2 人工智能
摘要
多模态人体动作分割是一项关键且具有挑战性的任务,应用广泛。当前大多数方法集中于密集信号(即RGB、光流与深度图)的融合。然而,稀疏IoT传感器信号——其对实现准确识别可能至关重要——的潜在贡献尚未被充分挖掘。为此,我们提出一种稀疏信号引导的Transformer(SigFormer)以结合密集与稀疏信号。我们采用掩码注意力,通过将交叉注意力约束在稀疏信号有效的区域内来融合局部化特征。但由于稀疏信号是离散的,其缺乏关于时间动作边界的充足信息。因此,在SigFormer中,我们提出在两个阶段强调边界信息以缓解该问题。在首个特征提取阶段,我们引入一个中间瓶颈模块,通过内部损失函数联合学习各密集模态的类别与边界特征。在密集模态与稀疏信号融合后,我们进而设计了一种双分支架构,显式建模动作类别与时间边界之间的相互关系。实验结果表明,SigFormer在来自真实工业环境的多模态动作分割数据集上优于当前最优方法,取得了0.958的卓越F1分数。代码与预训练模型已发布于 https://github.com/LIUQI-creat/SigFormer。
引用
@article{arxiv.2311.17428,
title = {SigFormer: Sparse Signal-Guided Transformer for Multi-Modal Human Action Segmentation},
author = {Qi Liu and Xinchen Liu and Kun Liu and Xiaoyan Gu and Wu Liu},
journal= {arXiv preprint arXiv:2311.17428},
year = {2024}
}