用于教学活动的跨模态对比蒸馏预测
计算机视觉与模式识别
2022-01-19 v1
摘要
本研究旨在基于对已发生过去的观测预测合理的未来动作步骤,并研究教学活动的预测任务。与以往旨在动作标签预测的预测任务不同,我们的工作目标是生成自然语言输出,提供对未来动作步骤的可解释且准确的描述。由于从教学视频中提取的语义信息匮乏,这是一项具有挑战性的任务。为克服该挑战,我们提出一种新颖的知识蒸馏框架,利用相关的外部文本知识辅助视觉预测任务。然而,以往的蒸馏技术通常在同模态内传递信息。为在蒸馏过程中弥合视觉与文本模态间的鸿沟,我们设计了一种新颖的跨模态对比蒸馏(CCD)方案,借助所提出的跨模态蒸馏损失,促进异质模态间教师与学生模型的知识蒸馏。我们在 Tasty Videos 数据集上评估了方法。CCD 使仅视觉学生模型在 BLEU4 上的预测性能相对提升达 40.2%。我们的方法也大幅优于最先进的方法。
引用
@article{arxiv.2201.06734,
title = {Cross-modal Contrastive Distillation for Instructional Activity Anticipation},
author = {Zhengyuan Yang and Jingen Liu and Jing Huang and Xiaodong He and Tao Mei and Chenliang Xu and Jiebo Luo},
journal= {arXiv preprint arXiv:2201.06734},
year = {2022}
}