中文

文本衍生知识助力视觉:一种用于基于视频的动作预期的简单跨模态蒸馏

计算机视觉与模式识别 2023-02-22 v2 计算与语言 机器学习

摘要

在视频中预测未来动作对许多自主与辅助技术十分有用。多数先前的动作预期工作将其视为视觉模态问题,模型主要从动作预期数据集中的视频特征学习任务信息。然而,关于动作序列的知识也可从外部文本数据获得。本工作中,我们展示了预训练语言模型中的知识如何被适配并蒸馏进基于视觉的动作预期模型。我们表明,一种简单的蒸馏技术即可实现有效的知识迁移,并在两个动作预期数据集上为强视觉模型(Anticipative Vision Transformer)带来一致提升(在 EGTEA-GAZE+ 上相对提升 3.5%,在 EPIC-KITCHEN 55 上相对提升 7.2%),取得了新的最先进结果。

关键词

引用

@article{arxiv.2210.05991,
  title  = {Text-Derived Knowledge Helps Vision: A Simple Cross-modal Distillation for Video-based Action Anticipation},
  author = {Sayontan Ghosh and Tanvi Aggarwal and Minh Hoai and Niranjan Balasubramanian},
  journal= {arXiv preprint arXiv:2210.05991},
  year   = {2023}
}