超越教学视频:在 YouTube 上探究更多样的视觉-文本接地
计算与语言
2020-10-19 v2 计算机视觉与模式识别
摘要
从未标注的网络视频中进行预训练已迅速成为在许多视频理解任务上取得高性能的事实标准手段。特征是通过预测视觉内容与自动语音识别(ASR)词元之间的接地关系来学习的。然而,先前的预训练工作仅限于教学视频;先验地,我们预期该领域相对“容易”:教学视频中的说话者常会提及所描绘的字面物体/动作。我们问:能否在更多样的视频语料上训练类似模型?若能,哪些类型的视频是“接地”的,哪些不是?我们将一个代表性的预训练模型拟合到多样的 YouTube8M 数据集上,并研究其成功与失败案例。我们发现视觉-文本接地在先前未探索的视频类别中确实可行,且在更多样集合上的预训练所产生的表征可泛化到非教学与教学领域。
引用
@article{arxiv.2004.14338,
title = {Beyond Instructional Videos: Probing for More Diverse Visual-Textual Grounding on YouTube},
author = {Jack Hessel and Zhenhai Zhu and Bo Pang and Radu Soricut},
journal= {arXiv preprint arXiv:2004.14338},
year = {2020}
}
备注
11 pages including supplementary materials