中文

VideoChain:基于 Transformer 的多跳视频问题生成框架

计算机视觉与模式识别 2025-11-12 v1

摘要

多跳问题生成 (QG) 能有效评估推理能力,但目前仍局限于文本;视频问题生成 (VideoQG) 则仅限于对单一片段的零跳问题。为解决这一问题,我们引入了 VideoChain,一种新颖的多跳视频问题生成 (MVQG) 框架,旨在生成需要对多个时间上分离的视频片段进行推理的问题。VideoChain 采用模块化架构,建立在经过修改并增强视频嵌入的 BART 骨干网络之上,以捕捉文本与视觉依赖关系。我们使用 TVQA+ 数据集,通过合并零跳问答对自动构建了大规模的 MVQ-60 数据集,确保了可扩展性与多样性。评估结果表明,VideoChain 在标准生成指标上表现优异:ROUGE-L (0.6454)、ROUGE-1 (0.6854)、BLEU-1 (0.6711)、BERTScore-F1 (0.7967) 以及语义相似度 (0.8110)。这些结果凸显了该模型生成连贯、有上下文基础且推理密集型问题的能力。

关键词

引用

@article{arxiv.2511.08348,
  title  = {VideoChain: A Transformer-Based Framework for Multi-hop Video Question Generation},
  author = {Arpan Phukan and Anupam Pandey and Deepjyoti Bodo and Asif Ekbal},
  journal= {arXiv preprint arXiv:2511.08348},
  year   = {2025}
}