面向自动新闻视频分割的图像、视频与音频分类器的比较分析
计算机视觉与模式识别
2025-03-31 v1 人工智能
摘要
新闻视频需要高效的内容组织和检索系统,但其非结构化的特性为自动化处理带来了显著挑战。本文提出了关于自动新闻视频分割中图像、视频与音频分类器的全面比较分析。本工作开发并评估了多种深度学习方法,包括ResNet、ViViT、AST以及多模态架构,用于对五种不同的片段类型进行分类:广告、故事、工作室场景、转换和可视化。我们使用由41个新闻视频组成、包含1832个场景剪辑的自定义标注数据集。实验结果表明,图像基分类器的性能优于更复杂的时序模型(准确率达84.34%)。值得注意的是,ResNet架构虽然超越了最新的视频分类器,却显著减少了计算资源的消耗。二元分类模型在转换(94.23%)和广告(92.74%)上的准确率很高。这些发现推动了对新闻视频分割有效架构的理解,为在媒体应用中实现自动化内容组织系统(包括媒体归档、个性化内容交付和智能视频搜索)提供了实用见解。
引用
@article{arxiv.2503.21848,
title = {Comparative Analysis of Image, Video, and Audio Classifiers for Automated News Video Segmentation},
author = {Jonathan Attard and Dylan Seychell},
journal= {arXiv preprint arXiv:2503.21848},
year = {2025}
}
备注
Preprint for paper in CAI 2025, 7 pages, 5 tables, 3 tables