中文

基于文本的输入模态在动作预测中的有效性研究

计算机视觉与模式识别 2024-08-30 v3 人工智能 机器学习 图像与视频处理

摘要

预测未来动作是一项极具挑战性的任务,因为潜在未来动作的多样性和规模巨大;然而,来自不同模态的信息有助于缩小合理的动作选择范围。每种模态都能为模型提供多样化且通常互补的上下文信息以供学习。以往的多模态方法利用视频和音频等模态的信息,而我们主要探索动作和物体的文本描述如何通过提供额外的上下文线索(例如关于环境及其内容的信息)来实现更准确的动作预测。我们提出了多模态对比预测Transformer(M-CAT),这是一种视频Transformer架构,能够联合学习多模态特征以及动作和物体的文本描述。我们分两个阶段训练模型:首先,模型学习将视频片段与未来动作的描述对齐;随后,进行微调以预测未来动作。与现有方法相比,M-CAT的优势在于能够从两种类型的文本输入中学习额外的上下文:预训练期间对未来动作的丰富描述,以及在模态特征融合期间对检测到的物体和动作的文本描述。通过广泛的实验评估,我们证明了我们的模型在EpicKitchens数据集上优于先前的方法,并表明使用简单的动作和物体文本描述有助于更有效的动作预测。此外,我们还研究了通过文本获取的物体和动作信息的影响,并进行了广泛的消融实验。

关键词

引用

@article{arxiv.2401.12972,
  title  = {On the Efficacy of Text-Based Input Modalities for Action Anticipation},
  author = {Apoorva Beedu and Harish Haresamudram and Karan Samel and Irfan Essa},
  journal= {arXiv preprint arXiv:2401.12972},
  year   = {2024}
}