通过想象学习预见自我中心动作
计算机视觉与模式识别
2021-01-20 v2
摘要
在执行前预见动作对包括自动驾驶和机器人在内的广泛实际应用至关重要。本文中,我们研究自我中心动作预见任务,该任务针对自我中心视频在动作执行前数秒预测未来动作。先前方法侧重于总结已观测内容并基于过去观测直接预测未来动作。我们认为,若能挖掘一些线索以补偿未观测帧缺失的信息,将有益于动作预见。我们进而提出将动作预见分解为一系列未来特征预测。我们想象视觉特征在近未来的变化,并基于这些想象表征预测未来动作标签。不同的是,我们的ImagineRNN以对比学习的方式而非特征回归进行优化。我们利用一个代理任务来训练ImagineRNN,即从干扰项中选出正确的未来状态。我们通过残差预见进一步改进ImagineRNN,即将其目标改为预测相邻帧的特征差异而非帧内容。这促使网络聚焦于我们的目标,即未来动作,因为相邻帧特征之间的差异对预测未来更为重要。在两个大规模自我中心动作数据集上的大量实验验证了我们的方法的有效性。我们的方法在EPIC Kitchens动作预见挑战的可见测试集与未见测试集上均显著优于先前方法。
引用
@article{arxiv.2101.04924,
title = {Learning to Anticipate Egocentric Actions by Imagination},
author = {Yu Wu and Linchao Zhu and Xiaohan Wang and Yi Yang and Fei Wu},
journal= {arXiv preprint arXiv:2101.04924},
year = {2021}
}
备注
Accepted to IEEE Transactions on Image Processing (TIP)