DynaStride:用于指令化多场景描述的动态步幅窗口与MMCoT
计算机视觉与模式识别
2025-12-02 v2 人工智能
机器学习
摘要
场景级描述生成可通过理解视觉线索和时序结构来增强学习,使其支持程序化学习和多模态推理,为技能获取提供更丰富的上下文。然而,未能捕获此类结构的描述缺乏连贯性和质量,可能引发误解,削弱视频的教育意图。为此,我们提出DynaStride,一个用于生成无需手动场景分段的连贯场景级描述的管道。利用 YouCookII 数据集的场景注释,DynaStride 执行自适应帧采样和多模态窗口,以捕获每个场景内的关键转换。随后,它采用多模态链式思维过程生成多个动作-对象对,这些对被动态步幅窗口选择算法所细化和融合,以自适应平衡时序上下文与冗余性。最终的场景级描述将视觉语义与时序推理整合为单一的指令化描述。针对VLLaMA3和GPT-4o等强大基线的实证评估显示,DynaStride 在基于N-gram的指标(BLEU、METEOR)和语义相似性度量(BERTScore、CLIPScore)上均实现一致提升。定性分析进一步表明,DynaStride 生成的描述在时序连贯性和信息性方面更佳,为改进 AI 驱动的教育内容生成指明了前景。
引用
@article{arxiv.2510.23907,
title = {DynaStride: Dynamic Stride Windowing with MMCoT for Instructional Multi-Scene Captioning},
author = {Eddison Pham and Prisha Priyadarshini and Adrian Maliackel and Kanishk Bandi and Cristian Meo and Kevin Zhu},
journal= {arXiv preprint arXiv:2510.23907},
year = {2025}
}
备注
16 pages, 15 figures, 5 Tables, Accepted at NeurIPS 7HVU Workshop, Accepted at AAAI AI4ED Workshop