中文

OmniScript:面向长片电影的音视脚本生成

计算机视觉与模式识别 2026-04-14 v1 多媒体

摘要

当前的多模态大语言模型(MLLM)在短篇视频理解方面表现突出,但将长篇电影视频翻译为带有时间细节的层次化脚本仍是重大挑战。本文提出全新的视频到脚本(V2S)任务,旨在生成包含角色动作、对白、表情和音频线索的分层、场景化脚本。为实现此目标,我们构建了一个首个以人类标注为主的基准数据集,并提出了时序感知的层次化评估框架。进一步,本文提出OmniScript——一个8B参数的全模态(音视)语言模型,专为长篇叙事理解而设计。OmniScript通过分阶段训练完成:首先利用链式思考监督微调进行情节和角色推理,然后利用时序分段奖励进行强化学习。大量实验表明,尽管参数规模相对较小,OmniScript在时间局限性和多字段语义准确性方面显著优于更大的开源模型,甚至在性能上与谷歌Gemini 3-Pro等最先进专有模型持平。

关键词

引用

@article{arxiv.2604.11102,
  title  = {OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video},
  author = {Junfu Pu and Yuxin Chen and Teng Wang and Ying Shan},
  journal= {arXiv preprint arXiv:2604.11102},
  year   = {2026}
}

备注

Project Page: https://arcomniscript.github.io