致力于释放 CLIP 在视频高亮检测任务中的潜能
计算机视觉与模式识别
2024-04-03 v1 人工智能
摘要
多模态和大语言模型(LLM)彻底改变了开放世界知识的利用方式,为各类任务和应用开辟了新可能。在视频领域尤为显著。本文提出了 Highlight-CLIP(HL-CLIP)方法,通过利用多模态模型中嵌入的预训练知识,在视频高亮检测任务中实现领先水平。我们仅通过对多模态编码器进行微调,并结合创新的显著性池化技术,便在高亮检测任务中取得最先进的性能,涵盖 QVHighlight 基准数据集。
引用
@article{arxiv.2404.01745,
title = {Unleash the Potential of CLIP for Video Highlight Detection},
author = {Donghoon Han and Seunghyeon Seo and Eunhwan Park and Seong-Uk Nam and Nojun Kwak},
journal= {arXiv preprint arXiv:2404.01745},
year = {2024}
}