中文

TriPSS:基于感知、结构与语义表示的三模态关键帧提取框架

计算机视觉与模式识别 2025-09-03 v2 信息检索 多媒体 图像与视频处理

摘要

高效关键帧提取对于视频摘要和检索至关重要,但捕捉视频内容的完整语义与视觉丰富性仍具有挑战性。我们引入 TriPSS,一个三模态框架,集成来自 CIELAB 色彩空间的感知特征、来自 ResNet-50 的结构嵌入,以及由 LLaMA-3.2-11B-Vision-Instruct 生成的帧级描述语义上下文。这些模态通过主成分分析(PCA)融合,形成紧凑的多模态嵌入,实现自适应视频分段通过 HDBSCAN 聚类。 refinement 阶段融合质量评估与重复过滤,确保最终关键帧集合既简洁又语义多样化。在 TVSum20 和 SumMe 基准数据集上的评估表明,TriPSS 实现了最先进的性能,显著优于单模态和既有多模态方法。这些结果凸显了 TriPSS 捕捉互补视觉与语义线索的能力,使其成为视频摘要、检索和大规模多媒体理解的有效解决方案。

关键词

引用

@article{arxiv.2506.05395,
  title  = {TriPSS: A Tri-Modal Keyframe Extraction Framework Using Perceptual, Structural, and Semantic Representations},
  author = {Mert Can Cakmak and Nitin Agarwal and Diwash Poudel},
  journal= {arXiv preprint arXiv:2506.05395},
  year   = {2025}
}