HiVid-Narrator:基于场景激发的层次化视频叙事生成
计算机视觉与模式识别
2026-01-13 v1
摘要
为现实电商视频生成结构化叙事,模型需要感知细粒度的视觉细节并将其组织成连贯的高层次故事——而现有方法在统一这两种能力方面存在挑战。我们引入了电商层次化视频描述数据集(E-commerce Hierarchical Video Captioning, E-HVC),包含双粒度、时空对齐的标注:一种是锚定事件级观察的时序链式思维(Temporal Chain-of-Thought),另一种是将其组成简洁、以故事为中心的概要(Chapter Summary)。而非直接提示章节内容,我们采用分阶段构建方式:首先通过精选的ASR转录文本和帧级描述收集可靠的语言和视觉证据,然后在时序链式思维的条件下,将粗糙的标注细化为精确的章节边界和标题,从而生成基于事实且时空对齐的叙事。我们还发现,电商视频节奏快、信息密集,视觉标记占主导地位。为在保持训练效率的同时减少输入标记,我们提出了基于ASR语义线索压缩多模态标记的场景激发压缩器(Scene-Primed ASR-anchored Compressor, SPA-Compressor),其将多模态标记压缩为层次化的场景和事件表示。基于上述设计,我们的HiVid-Narrator框架在更少的输入标记下实现了优于现有方法的叙事质量。
引用
@article{arxiv.2601.07366,
title = {HiVid-Narrator: Hierarchical Video Narrative Generation with Scene-Primed ASR-anchored Compression},
author = {Haoxuan Li and Mengyan Li and Junjun Zheng},
journal= {arXiv preprint arXiv:2601.07366},
year = {2026}
}