多少观测足以?面向轨迹预测的知识蒸馏
计算机视觉与模式识别
2022-03-10 v1 人工智能
摘要
准确预测未来人体位置是现代视频监控系统的一项基本任务。当前最先进的模型通常依赖过去跟踪位置的“历史”(例如 3 到 5 秒)来预测合理的未来位置序列(例如直至接下来 5 秒)。我们认为这种常见模式忽视了现实应用的关键特性:由于输入轨迹的采集涉及机器感知(即检测与跟踪),在拥挤场景中错误检测与碎片化误差可能累积,导致跟踪漂移。就此而言,模型将被输入损坏且含噪的数据,从而致命地影响其预测性能。在这方面,我们专注于仅使用少量输入观测时提供准确预测,从而潜在降低与自动感知相关的风险。为此,我们构想了一种新颖的蒸馏策略,允许从教师网络向学生网络进行知识迁移,后者仅输入更少观测(仅两个)。我们表明,恰当定义的教师监督使得学生网络性能可与需要更多观测的最先进方法相媲美。此外,在常用轨迹预测数据集上的大量实验强调,我们的学生网络能更好地泛化至未见场景。
引用
@article{arxiv.2203.04781,
title = {How many Observations are Enough? Knowledge Distillation for Trajectory Forecasting},
author = {Alessio Monti and Angelo Porrello and Simone Calderara and Pasquale Coscia and Lamberto Ballan and Rita Cucchiara},
journal= {arXiv preprint arXiv:2203.04781},
year = {2022}
}
备注
Accepted by CVPR 2022