中文

DynaStride:用于指令化多场景描述的动态步幅窗口与MMCoT

计算机视觉与模式识别 2025-12-02 v2 人工智能 机器学习

摘要

场景级描述生成可通过理解视觉线索和时序结构来增强学习,使其支持程序化学习和多模态推理,为技能获取提供更丰富的上下文。然而,未能捕获此类结构的描述缺乏连贯性和质量,可能引发误解,削弱视频的教育意图。为此,我们提出DynaStride,一个用于生成无需手动场景分段的连贯场景级描述的管道。利用 YouCookII 数据集的场景注释,DynaStride 执行自适应帧采样和多模态窗口,以捕获每个场景内的关键转换。随后,它采用多模态链式思维过程生成多个动作-对象对,这些对被动态步幅窗口选择算法所细化和融合,以自适应平衡时序上下文与冗余性。最终的场景级描述将视觉语义与时序推理整合为单一的指令化描述。针对VLLaMA3和GPT-4o等强大基线的实证评估显示,DynaStride 在基于N-gram的指标(BLEU、METEOR)和语义相似性度量(BERTScore、CLIPScore)上均实现一致提升。定性分析进一步表明,DynaStride 生成的描述在时序连贯性和信息性方面更佳,为改进 AI 驱动的教育内容生成指明了前景。

关键词

引用

@article{arxiv.2510.23907,
  title  = {DynaStride: Dynamic Stride Windowing with MMCoT for Instructional Multi-Scene Captioning},
  author = {Eddison Pham and Prisha Priyadarshini and Adrian Maliackel and Kanishk Bandi and Cristian Meo and Kevin Zhu},
  journal= {arXiv preprint arXiv:2510.23907},
  year   = {2025}
}

备注

16 pages, 15 figures, 5 Tables, Accepted at NeurIPS 7HVU Workshop, Accepted at AAAI AI4ED Workshop