中文

基于类原型的对比学习用于多标签和细粒度教育视频分类

计算机视觉与模式识别 2025-10-14 v1

摘要

随着儿童在早期幼儿阶段对在线媒体消费量的增长,数据驱动的工具变得至关重要,以帮助教育者筛选适合年幼学习者的教育内容。本文提出了一种用于检测教育视频内容的方法。我们关注两种常用的教育内容类别:识字和数学。对于每一类,根据常规标准(Common Core Standards)选择突出的代码(子类)。例如,识字代码包括“字母名称”、“字母音”等,数学代码包括“计数”、“排序”等。我们将其建模为多标签细粒度分类问题,因为视频可以包含多种类型的教育内容,且内容类别在视觉上可能相似(例如,“字母名称”与“字母音”)。我们提出了一种基于类原型的监督对比学习方法,可处理与多个标签关联的细粒度样本。我们为每个类别学习一个类原型,并采用一种损失函数来最小化类原型与来自该类别的样本之间的距离,同时最大化类原型与来自其他类别的样本之间的距离。由于视觉与音频线索的对齐对于有效理解至关重要,我们考虑使用多模态变换器网络来捕捉视频中视觉与音频线索之间的相互作用。为进行评估,我们提出了 APPROVE 数据集,包含来自 YouTube 的教育视频,由教育研究人员标注细粒度教育类别。APPROVE 包含 193 小时的专家标注视频,涵盖 19 个类别。我们的方法在 APPROVE 和其他基准数据集(如 Youtube-8M、COIN) 上均优于强大的基线方法。数据集可在 https://github.com/rohit-gupta/MMContrast/tree/main/APPROVE 获取。

关键词

引用

@article{arxiv.2510.11204,
  title  = {Class Prototypes based Contrastive Learning for Classifying Multi-Label and Fine-Grained Educational Videos},
  author = {Rohit Gupta and Anirban Roy and Claire Christensen and Sujeong Kim and Sarah Gerard and Madeline Cincebeaux and Ajay Divakaran and Todd Grindal and Mubarak Shah},
  journal= {arXiv preprint arXiv:2510.11204},
  year   = {2025}
}

备注

Published at CVPR 2023