中文

CourseTimeQA:面向教学视频时戳问答的时间限制跨模态融合基准与方法

计算与语言 2025-12-02 v1

摘要

我们研究了在单GPU时延/内存预算下对教育讲座视频进行时戳问答的任务。给定自然语言查询,系统检索相关时戳片段并合成答案。我们提出CourseTimeQA(52.3小时,902个查询,覆盖六门课程),以及一种轻量级时延受限跨模态检索器(CrossFusion-RAG),其融合了冻结编码器、512→768视觉投影、对ASR文本与视频帧的浅层查询无关跨注意力机制,辅以时间一致性正则化,以及小型跨注意力重排器。在CourseTimeQA上,CrossFusion-RAG相较于强大的BLIP-2检索器在nDCG@10提升0.10,MRR提升0.08,同时在单张A100上实现约1.55秒的中位端到端时延。最接近的比较方法(零样态CLIP多帧池化;CLIP+跨编码器重排器+MMR;学习型晚期融合门控;文本-only混合式交叉编码器重排及其MMR变体; caption增强文本检索;非学习型时间平滑)均在匹配硬件与索引条件下评估。我们报告了在ASR噪声(WER分位数)下的鲁棒性、时序定位诊断,以及完整的训练/调优细节,以支持可重复比较。

关键词

引用

@article{arxiv.2512.00360,
  title  = {CourseTimeQA: A Lecture-Video Benchmark and a Latency-Constrained Cross-Modal Fusion Method for Timestamped QA},
  author = {Vsevolod Kovalev and Parteek Kumar},
  journal= {arXiv preprint arXiv:2512.00360},
  year   = {2025}
}

备注

5 figures, 8 tables