中文

多层级与多模态动作预测

计算机视觉与模式识别 2025-06-04 v1 机器学习

摘要

动作预测,即从部分观测视频中预测未来动作的任务,对推进智能系统至关重要。与在完全观测视频上运行的动作识别不同,动作预测必须处理不完整信息。因此,它需要时间推理和固有的不确定性处理。尽管近期取得了一些进展,但传统方法通常仅关注视觉模态,忽略了整合多种信息源的潜力。受人类行为的启发,我们引入了多层级与多模态动作预测 (m\&m-Ant),这是一种新颖的多模态动作预测方法,它结合了视觉和文本线索,同时显式地建模层次语义信息以实现更准确的预测。为了解决粗略动作标签不准确的问题,我们提出了一个细粒度标签生成器,并配以专门的时序一致性损失函数来优化性能。在广泛使用的数据集(包括 Breakfast、50 Salads 和 DARai)上的大量实验证明了我们方法的有效性,与现有方法相比,平均预测准确率提高了 3.08\%,达到了 SOTA 结果。这项工作突显了多模态和层次建模在推进动作预测方面的潜力,并为该领域未来的研究确立了新的基准。我们的代码可在以下地址获取:https://github.com/olivesgatech/mM-ant。

关键词

引用

@article{arxiv.2506.02382,
  title  = {Multi-level and Multi-modal Action Anticipation},
  author = {Seulgi Kim and Ghazal Kaviani and Mohit Prabhushankar and Ghassan AlRegib},
  journal= {arXiv preprint arXiv:2506.02382},
  year   = {2025}
}

备注

Accepted in 2025 IEEE International Conference on Image Processing (ICIP)