中文

用于多模态视觉动作识别的集成建模方法

计算机视觉与模式识别 2023-09-26 v2

摘要

在这项工作中,我们提出了一种用于多模态动作识别的集成建模方法。我们使用一种针对MECCANO [21]数据集长尾分布定制的焦点损失变体独立训练各个模态模型。基于焦点损失捕捉尾部(稀缺)类别与其预测难度之间关系的基本原理,我们提出了一种用于当前任务的指数衰减焦点损失变体。它最初强调从困难误分类样本中学习,并逐渐适应数据集中的全部样本范围。这一退火过程鼓励模型在聚焦于稀疏困难样本与同时利用较简单样本所提供的信息之间取得平衡。此外,我们采用后期融合策略,结合来自RGB与深度模态的结果概率分布进行最终动作预测。在MECCANO数据集上的实验评估证明了我们方法的有效性。

关键词

引用

@article{arxiv.2308.05430,
  title  = {Ensemble Modeling for Multimodal Visual Action Recognition},
  author = {Jyoti Kini and Sarah Fleischer and Ishan Dave and Mubarak Shah},
  journal= {arXiv preprint arXiv:2308.05430},
  year   = {2023}
}

备注

22nd International Conference on Image Analysis and Processing Workshops - Multimodal Action Recognition on the MECCANO Dataset, 2023