基于标签平滑的动作预期知识蒸馏
计算机视觉与模式识别
2020-12-21 v2 机器学习
摘要
人类从视觉观测和非言语线索中预期近未来的能力,对开发需要与人员交互的智能系统至关重要。若干研究领域如人机交互(HRI)、辅助生活或自动驾驶均需预见未来事件以避免碰撞或帮助人们。以自我为中心的场景因其众多应用而成为动作预期的典型例子。此类具挑战性的任务要求捕获并建模领域的隐藏结构以降低预测不确定性。由于未来可能同等发生多个动作,我们将动作预期视为带缺失标签的多标签问题,扩展了标签平滑的概念。该思想类似于知识蒸馏过程,因为有用的信息在训练期间被注入模型。我们实现了基于长短期记忆(LSTM)网络的多模态框架,以总结过去观测并在不同时间步做出预测。我们在 EPIC-Kitchens 和 EGTEA Gaze+ 数据集上进行了大量实验,分别包含超过 2500 和 100 个动作类别。实验表明标签平滑系统性地改善了动作预期最先进模型的性能。
引用
@article{arxiv.2004.07711,
title = {Knowledge Distillation for Action Anticipation via Label Smoothing},
author = {Guglielmo Camporese and Pasquale Coscia and Antonino Furnari and Giovanni Maria Farinella and Lamberto Ballan},
journal= {arXiv preprint arXiv:2004.07711},
year = {2020}
}
备注
Accepted to ICPR 2020