增强学习体验:利用视觉-语言模型为教育视频生成问题
计算机视觉与模式识别
2025-05-06 v1 计算与语言
多媒体
摘要
基于网络的教育视频提供了灵活的学习机会,并且越来越受欢迎。然而,提高用户参与度和知识留存率仍然是一个挑战。自动生成的问题可以激活学习者并支持他们的知识获取。此外,它们可以帮助教师和学习者评估他们的理解程度。虽然大型语言模型和视觉-语言模型已被用于各种任务,但它们在教育视频问题生成中的应用仍处于探索不足的状态。在本文中,我们研究了当前视觉-语言模型为教育视频内容生成面向学习的问题的能力。我们评估了 (1) 开箱即用模型的性能;(2) 微调对特定内容问题生成的影响;(3) 不同视频模态对问题质量的影响;以及 (4) 在一项定性研究中,生成问题的相关性、可回答性和难度级别。我们的发现描绘了当前视觉-语言模型的能力,强调了微调的必要性,并解决了问题多样性和相关性方面的挑战。我们确定了未来多模态数据集的需求,并概述了有前景的研究方向。
引用
@article{arxiv.2505.01790,
title = {Enhancing the Learning Experience: Using Vision-Language Models to Generate Questions for Educational Videos},
author = {Markos Stamatakis and Joshua Berger and Christian Wartena and Ralph Ewerth and Anett Hoppe},
journal= {arXiv preprint arXiv:2505.01790},
year = {2025}
}
备注
12 pages (excluding references), 8 tables, 1 equation