利用多模态和多阶段分析自动化视频缩略图的选择与生成
计算机视觉与模式识别
2024-10-29 v1
摘要
本论文提出了一种创新方法,用于自动化传统广播内容的视频缩略图选择。我们的方法为多样化、有代表性且美观的缩略图建立了严格的标准,考虑了诸如标志放置空间、垂直宽高比的整合以及面部身份和情绪的准确识别等因素。我们引入了一个复杂的多阶段流水线,该流水线可以选择候选帧,或通过混合视频元素或使用扩散模型生成新颖图像。该流水线整合了用于各种任务的最先进模型,包括降采样、冗余减少、自动裁剪、人脸识别、闭眼和情绪检测、镜头尺度和美学预测、分割、抠图以及和谐化。它还利用大型语言模型和视觉变换器来确保语义一致性。一个GUI工具便于快速浏览流水线的输出。为了评估我们的方法,我们进行了全面的实验。在一项针对69个视频的研究中,我们提出的集合中有53.6%包含了专业设计师选择的缩略图,其中73.9%包含相似图像。一项针对82名参与者的调查显示,45.77%的人偏好我们的方法,而手动选择缩略图和另一种方法的偏好率分别为37.99%和16.36%。专业设计师报告称,与另一种方法相比,有效候选者增加了3.57倍,这证实了我们的方法符合既定标准。总之,我们的研究结果证实,所提出的方法在保持高质量标准和促进更高用户参与度的同时,加速了缩略图的创建。
引用
@article{arxiv.2410.19825,
title = {Automating Video Thumbnails Selection and Generation with Multimodal and Multistage Analysis},
author = {Elia Fantini},
journal= {arXiv preprint arXiv:2410.19825},
year = {2024}
}
备注
150 pages, 60 figures