ARC-Chapter:将时长为小时的视频结构化为可导航的章节和层次摘要
计算机视觉与模式识别
2025-11-19 v1
摘要
小时级视频(如讲座、播客、纪录片)的流行加剧了对高效内容结构化的需求。然而,现有方法受限于小规模训练,通常采用粗糙且短暂的注释,限制了其对长视频中细腻转变的泛化能力。我们提出 ARC-Chapter,是首个在超千万级别长视频章节上进行训练的视频章节模型,特点是双语、时空对齐且具有层次结构的章节注释。为实现此目标,我们通过结构化管道整合 ASR 转录文本、场景文本和视觉标题,构建了从短标题到长摘要的多层次注释。我们表明数据规模(包括数据量和标签强度)的提升显著改善了性能。此外,我们设计了新的评估指标 GRACE,融合了许多对一段重叠和语义相似性,更贴合实际章节灵活性。广泛实验表明,ARC-Chapter 以显著幅度实现了新的状态-of-the-art,F1 分数提升 14.0%,SODA 分数提升 11.3%。此外,ARC-Chapter 在下游任务上表现出色,如在 YouCook2 上的稠密视频描述。
关键词
引用
@article{arxiv.2511.14349,
title = {ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries},
author = {Junfu Pu and Teng Wang and Yixiao Ge and Yuying Ge and Chen Li and Ying Shan},
journal= {arXiv preprint arXiv:2511.14349},
year = {2025}
}
备注
Project Page: https://arcchapter.github.io/index_en.html