YTCommentQA:教学视频中的视频问答可回答性
计算机视觉与模式识别
2024-02-01 v1 人工智能
摘要
教学视频为各种任务提供了详细的操作指南,观众经常就内容提出问题。解决这些问题对于理解内容至关重要,但获得即时回答却很困难。虽然已经为视频问答(Video QA)任务开发了许多计算模型,但它们主要基于视频内容生成的问题进行训练,旨在从内容中产生答案。然而,在现实场景中,用户可能会提出超出视频信息范围的问题,这凸显了判断视频能否提供答案的必要性。由于视频的多模态特性,即视觉和语言信息相互交织,辨别一个问题能否被视频内容回答具有挑战性。为了弥补这一差距,我们提出了YTCommentQA数据集,该数据集包含从YouTube自然生成的问题,并根据其可回答性以及回答问题所需的模态——视觉、脚本或两者兼有——进行分类。可回答性分类任务的实验证明了YTCommentQA的复杂性,并强调了理解视觉和脚本信息在视频推理中共同作用的必要性。该数据集可在https://github.com/lgresearch/YTCommentQA获取。
引用
@article{arxiv.2401.17343,
title = {YTCommentQA: Video Question Answerability in Instructional Videos},
author = {Saelyne Yang and Sunghyun Park and Yunseok Jang and Moontae Lee},
journal= {arXiv preprint arXiv:2401.17343},
year = {2024}
}
备注
AAAI 2024