教学视频音频转录文本中索引词的分析与可视化
信息检索
2016-11-15 v1 多媒体
摘要
我们引入了从低制作质量的教学视频中提取、分析和可视化文本内容的新技术。利用自动语音识别(Automatic Speech Recognition),从原始高度压缩的大学课程视频(每门课程包含 10 到 30 个讲座)中获得了近似转录文本(词错误率 >75%)。随后,使用以书籍或论文形式出现的课程配套文本材料,从看似不连贯的转录文本中过滤出有意义的短语。由此产生的转录文本索引被关联起来,并在 3 个实验性图表中进行可视化,这些图表有助于理解整体课程结构,并为定位特定主题以进行索引提供了工具。我们特别讨论了转录文本索引图(以图形方式展示课程的关键短语)、教科书章节与转录文本匹配图,以及讲座转录文本相似度图(将语义相似的讲座进行聚类)。我们在 7 门完整课程(包含 230 小时视频和 273 份转录文本)上测试了我们的方法和工具。对于给定的转录文本,我们最多能够提取 98 个唯一关键术语;对于整门课程,最多能够提取 347 个唯一关键术语。教科书章节与转录文本匹配的准确率平均超过 70%。所使用的方法可应用于具有重复主题词的视频类型(新闻、体育、会议等)。
引用
@article{arxiv.cs/0408063,
title = {Analysis and Visualization of Index Words from Audio Transcripts of Instructional Videos},
author = {Alexander Haubold and John R. Kender},
journal= {arXiv preprint arXiv:cs/0408063},
year = {2016}
}
备注
2004 IEEE International Workshop on Multimedia Content-based Analysis and Retrieval; 20 pages, 8 figures, 7 tables