StreamingCoT: 用于流式视频问答中时序动态和多模态链式思考的基准数据集
计算机视觉与模式识别
2025-10-30 v1
摘要
流式视频应用的快速增长需要具备增强时序动态理解和复杂推理能力的多模态模型。然而,当前的 Video Question Answering (VideoQA) 数据集存在两个关键局限性:1) 静态标注机制无法捕捉时序视频流中答案演变的本质,2) 缺乏显式推理过程标注限制了模型的可解释性和逻辑推理能力。在本文中,我们引入 StreamingCoT,是首个专为时序演变推理在流式 VideoQA 和多模态链式思考 (CoT) 任务中设计的数据集。我们的框架首先建立动态层次标注架构,通过相似度融合生成每秒稠密描述并构建时序相关语义片段,伴随受时序演变模式约束的问答集合。我们进一步提出显式推理链生成范式,通过关键帧语义对齐提取时空对象,使用大语言模型基于对象状态转换的推理路径,并通过人类验证确保逻辑一致性。该数据集为推进流式视频理解、复杂时序推理和多模态推断研究奠定了基础。我们的 StreamingCoT 及其构建工具包可在 https://github.com/Fleeting-hyh/StreamingCoT 上访问。
引用
@article{arxiv.2510.25332,
title = {StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA},
author = {Yuhang Hu and Zhenyu Yang and Shihan Wang and Shengsheng Qian and Bin Wen and Fan Yang and Tingting Gao and Changsheng Xu},
journal= {arXiv preprint arXiv:2510.25332},
year = {2025}
}