中文

HighlightMe:从以人为中心的视频中检测精彩片段

计算机视觉与模式识别 2024-11-26 v2

摘要

我们提出了一种与领域及用户偏好无关的、用于从以人为中心的视频中检测可高亮片段的方法。我们的方法基于视频中多个可观测的以人为中心的模态(如姿态和人脸)的图表示上工作。我们使用配备时空图卷积的自编码器网络,基于这些模态检测人类活动与交互。我们训练网络将基于活动和交互的不同模态的潜在结构表示映射到基于帧代表性的逐帧高亮分数。我们利用这些分数计算应高亮哪些帧,并将连续帧拼接以生成片段。我们在大规模 AVA-Kinetics 动作数据集上训练网络,并在四个基准视频高亮数据集上评估:DSH、TVSum、PHD2 和 SumMe。我们观察到,在这些数据集中匹配人类标注高亮的均值平均精度较最先进方法提升了 4–12%,且无需任何用户提供的偏好或数据集特定的微调。

关键词

引用

@article{arxiv.2110.01774,
  title  = {HighlightMe: Detecting Highlights from Human-Centric Videos},
  author = {Uttaran Bhattacharya and Gang Wu and Stefano Petrangeli and Viswanathan Swaminathan and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2110.01774},
  year   = {2024}
}

备注

10 pages, 5 figures, 5 tables. In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2021