基于关键状态记忆压缩的动作模式学习与跨时间相互作用
计算机视觉与模式识别
2026-02-24 v2
摘要
动作理解涵盖动作检测与预测,在众多实际应用中发挥关键作用。然而,未剪辑视频常包含大量冗余信息和噪声,且在建模动作理解时常忽视代理人意图对动作的影响。为此,我们提出了 State-Specific Model (SSM) 框架,以统一提升动作检测与预测任务。在框架中,关键状态记忆压缩模块将帧序列压缩为关键状态,以减少信息冗余。动作模式学习模块在此基础上构建带有多维边的状态转换图,以建模复杂情景下的动作动力学,并生成表示意图的潜在未来线索。此外,我们的跨时间相互作用模块通过跨时间相互作用建模意图与过去及当前信息之间的相互影响,从而细化当前和未来特征,实现同时进行的动作检测与预测。在多个基准数据集上进行的大量实验——包括 EPIC-Kitchens-100、THUMOS'14、TVSeries 以及我们引入的帕金森病小鼠行为 (PDMB) 数据集——表明,我们的框架在其他最新方法之上表现卓越。这些结果凸显了动作动力学学习和跨时间相互作用的重要性,为未来动作理解研究奠定了基础。
引用
@article{arxiv.2510.10682,
title = {Action-Dynamics Modeling and Cross-Temporal Interaction for Online Action Understanding},
author = {Xinyu Yang and Zheheng Jiang and Feixiang Zhou and Yihang Zhu and Na Lv and Nan Xing and Nishan Canagarajah and Huiyu Zhou},
journal= {arXiv preprint arXiv:2510.10682},
year = {2026}
}
备注
10 pages, 9 figures