中文

MovieTeller:用于ID一致性渐进抽象的电影 Synopsis 工具增强框架

计算机视觉与模式识别 2026-03-16 v2 人工智能

摘要

随着数字娱乐的爆发式增长,自动化视频摘要已成为内容索引、个性化推荐和高效媒体归档等应用中不可或缺的技术。然而,针对长篇视频(如电影和电视系列)的自动 Synopsis 生成仍是现有视觉语言模型(VLM)面临的重大挑战。虽然这些通用模型在单张图像描述方面表现出色,但在长时间段情境下常出现关键性失误,主要表现为缺乏ID一致的角色识别和叙事连贯性。为克服这些局限性,我们提出了 MovieTeller——一种通过工具增强渐进抽象生成电影 Synopsis 的新型框架。我们的核心贡献在于一种无需训练的、工具增强的、基于事实的生成过程。该框架无需昂贵的模型微调,即可以即插即用的方式直接利用现成的模型。我们首先调用专门的面部识别模型作为外部“工具”,建立事实 grounding——精确的角色身份及其对应的边界框。随后将这些 grounding 注入提示词中,以引导 VLM 的推理,确保生成的场景描述锚定于可验证的事实。此外,我们的渐进抽象管道将完整电影的摘要分解为多阶段处理,有效缓解当前 VLM 的上下文长度限制。实验表明,与端到端基线相比,我们的方法在事实准确性、角色一致性和整体叙事连贯性方面均取得显著提升。

关键词

引用

@article{arxiv.2602.23228,
  title  = {MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction},
  author = {Yizhi Li and Xiaohan Chen and Miao Jiang and Wentao Tang and Gaoang Wang},
  journal= {arXiv preprint arXiv:2602.23228},
  year   = {2026}
}

备注

6 pages, CSCWD 2026