向我展示我所喜爱:利用基于内容的多头注意力检测用户特定视频高光
计算机视觉与模式识别
2024-11-26 v3
摘要
我们提出一种方法,基于用户在已观看的先前视频上标记的首选高光片段,在给定目标视频上检测针对用户的个性化高光。我们的方法利用预训练的物体与人类活动特征,显式地借助首选片段与目标视频的内容。我们设计了一种多头注意力机制,基于首选片段中基于物体与人类活动的内容自适应地加权,并使用这些权重将其融合为每位用户的单一特征表示。我们计算这些每用户特征表示与从期望目标视频计算的逐帧特征之间的相似度,以估算来自目标视频的用户特定高光片段。我们在一个包含个体用户标注高光的大规模高光检测数据集上测试了我们的方法。与当前基线相比,我们观察到所检测高光的平均精度均值有 2–4% 的绝对提升。我们还对与每位用户关联的首选高光片段数量以及基于物体与人类活动的特征表示进行了广泛的消融实验,以验证我们的方法确实既基于内容又针对用户特定。
引用
@article{arxiv.2207.08352,
title = {Show Me What I Like: Detecting User-Specific Video Highlights Using Content-Based Multi-Head Attention},
author = {Uttaran Bhattacharya and Gang Wu and Stefano Petrangeli and Viswanathan Swaminathan and Dinesh Manocha},
journal= {arXiv preprint arXiv:2207.08352},
year = {2024}
}
备注
14 pages, 5 figures, 7 tables