面向大鼠感知的视频位置预测的运动-场景解耦:策略与基准
计算机视觉与模式识别
2023-07-24 v2
摘要
近来,利用深度学习技术在人类动作识别与行为预测方面取得了显著进展,提升了基于视觉的语义理解。然而,针对小型生物机器人仍缺乏高质量运动数据集,这为基于第三人称观测的长期运动预测与行为控制带来了更具挑战性的场景。在本研究中,我们引入 RatPose,一个通过考虑个体与环境的影响因素并基于预定义标注规则构建的生物机器人运动预测数据集。为增强运动预测对这些因素的鲁棒性,我们提出双流运动-场景解耦(Dual-stream Motion-Scenario Decoupling, DMSD)框架,有效分离面向场景与面向运动的特征,并设计场景对比损失与运动聚类损失用于整体训练。凭借这一独特架构,双分支特征流信息以先分解后融合的方式交互与补偿。此外,我们在不同难度级别任务上展示了所提 DMSD 框架的显著性能提升。我们还实现了长期离散化轨迹预测任务,以验证所提数据集的泛化能力。
引用
@article{arxiv.2305.18310,
title = {Motion-Scenario Decoupling for Rat-Aware Video Position Prediction: Strategy and Benchmark},
author = {Xiaofeng Liu and Jiaxin Gao and Yaohua Liu and Risheng Liu and Nenggan Zheng},
journal= {arXiv preprint arXiv:2305.18310},
year = {2023}
}
备注
Rat, Video Position Prediction