中文

基于场景先验增强的社交上下文感知图卷积网络用于视频人物搜索

多媒体 2023-05-23 v1

摘要

随着在线视频平台智能服务需求的增长,视频人物搜索任务因支持细粒度检索与摘要等下游应用而受到广泛关注。然而,传统方案仅关注视觉或粗粒度社交信息,因此在面对复杂场景(如变化的镜头视角或人物姿态)时表现不佳。基于此,我们利用社交信息与场景上下文作为先验知识来解决复杂场景下的人物搜索问题。具体而言,我们提出一个名为 SoCoSearch 的场景先验增强框架。我们首先整合多模态线索以获取场景上下文,估计社交关系的先验概率,然后捕捉人物共现以生成增强的社交上下文图。随后,我们设计了一种社交上下文感知的 GCN 框架,实现人物间特征传递,从而获得用于人物搜索任务的鲁棒表示。大量实验验证了 SoCoSearch 在各指标上的有效性。

关键词

引用

@article{arxiv.2305.12348,
  title  = {Social Context-aware GCN for Video Character Search via Scene-prior Enhancement},
  author = {Wenjun Peng and Weidong He and Derong Xu and Tong Xu and Chen Zhu and Enhong Chen},
  journal= {arXiv preprint arXiv:2305.12348},
  year   = {2023}
}

备注

Accepted by ICME 2023