中文

Script-a-Video:基于因子化流和关系 grounding 的深层结构音视频描述

计算机视觉与模式识别 2026-04-16 v2

摘要

多模态大语言模型(MLLMs)的快速发展正在将视频描述从一个描述性终点转变为视频理解与生成的语义接口。然而,主导范式仍将视频视为单一的叙事段落,将视觉、听觉和身份信息高度耦合。这种稠密的耦合不仅损害了表征保真度,也限制了可扩展性,因为即使是局部编辑也可能触发全局重写。为解决这一结构瓶颈,我们提出了一种新的范式——多流场景脚本(MTSS),用因子化且明确对齐的场景描述取代单一的文本。MTSS 建立在两个核心原则之上:流因子化(Stream Factorization)将视频解耦为互补的流(参考流、镜头流、事件流和全局流),以及关系对齐(Relational Grounding),通过显式的身份链接和时间链接将这些孤立的流重新连接起来,以保持整体视频的一致性。大量实验表明,MTSS 在各种模型上都显著提升了视频理解能力,在 Video-SALMONN-2 数据集上平均错误率降低 25%,在 Daily-Omni 推理基准上平均性能提升 67%。它还缩小了小型和大型 MLLMs 之间的性能差距,表明这是一个更具可学习性的caption界面。最后,even without architectural adaptation(无需架构调整),用 MTSS 替代单一提示进行多镜头视频生成,还能显著提升人类评估指标:跨镜头身份一致性提升 45%,音视频对齐提升 56%,时序可控性提升 71%。

关键词

引用

@article{arxiv.2604.11244,
  title  = {Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding},
  author = {Tencent Hunyuan Team},
  journal= {arXiv preprint arXiv:2604.11244},
  year   = {2026}
}