中文

面向长视频中时序角色分组的统一动态图

计算机视觉与模式识别 2024-06-25 v3 人工智能

摘要

视频时序角色分组根据身份定位主要角色在视频中的出现时刻。为此,近期工作从未监督聚类演进到基于图的监督聚类。然而,图方法建立在固定亲和图的前提下,带来许多不精确连接。此外,它们用各类模型提取多模态特征,不利于部署。本文提出一种用于时序角色分组的统一动态图(UniDG)框架。首先通过统一表示网络在同一空间内学习多模态表示并同时保留模态独特性来实现。其次,我们提出动态图聚类,通过循环匹配策略为每个节点动态构建不同数量的邻居,从而得到更可靠的亲和图。第三,引入渐进关联方法以利用不同模态间的空间与时间上下文,使多模态聚类结果得以良好融合。由于当前数据集仅提供预提取特征,我们在收集的数据集 MTCG 上评估 UniDG 方法,该数据集包含每个人物的面部与身体出现片段及语音轨。我们还在现有聚类与检索数据集上评估关键组件以验证泛化能力。实验结果表明,我们的方法能取得有前景的结果并优于若干最先进方法。

关键词

引用

@article{arxiv.2308.14105,
  title  = {Unified and Dynamic Graph for Temporal Character Grouping in Long Videos},
  author = {Xiujun Shu and Wei Wen and Liangsheng Xu and Ruizhi Qiao and Taian Guo and Hanjun Li and Bei Gan and Xiao Wang and Xing Sun},
  journal= {arXiv preprint arXiv:2308.14105},
  year   = {2024}
}