中文

挖掘视频多模态时空线索用于重要人物识别

计算机视觉与模式识别 2026-05-28 v1 人工智能

摘要

识别视频场景中的关键人物对于自动化视频编辑和智能监控等应用至关重要。当前方法主要关注静态图像和即时视觉线索,忽略了视频中丰富的时空信息。这导致出现时间重要性迁移(Temporal Importance Shift, TIS)现象,即在早期帧中被视为重要的人物在考虑整个时序上下文后可能被降级。为解决此问题,我们提出视频重要人物(Video Important Person, VIP)识别任务,旨在自动识别视频中最具影响力的人物,同时提供文本化理由。我们呈现了Temporal-VIP,一个大型带有对齐重要性理由的视频片段数据集,覆盖11个类别,包含9,249个视频片段。为缓解TIS,我们开发了VIP-Net框架,包括用于提取多模态时空线索的社交线索编码器(Social Cue Encoder, SCE)、用于层次化线索融合和跨模态对齐的时序重要性校正器(Temporal Importance Rectifier, TIR),以及VIP推断用于对人物进行排序。实验结果表明,VIP-Net实现了67.3%的准确率,显著优于最先进的模型(37.5%~53.9%),通过特征引导的大语言模型(LLM)细化后,理由相似性均为0.63。数据集和代码已公开于 https://huggingface.co/datasets/yml2002/Temporal-VIP。

关键词

引用

@article{arxiv.2605.28604,
  title  = {Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification},
  author = {Xiao Wang and Minglei Yang and Bin Yang and Wenke Huang and Zheng Wang and Xin Xu and Mang Ye},
  journal= {arXiv preprint arXiv:2605.28604},
  year   = {2026}
}