中文

面向文本驱动视频分割的演员与动作模块化网络

计算机视觉与模式识别 2022-08-23 v2

摘要

文本驱动视频分割旨在通过文本查询指定演员及其执行的动作,从而在视频序列中分割该演员。由于\emph{语义不对称}问题,先前方法未能根据演员及其动作以细粒度方式将视频内容与文本查询显式对齐。\emph{语义不对称}意指在多模态融合过程中两种模态包含不同数量的语义信息。为缓解此问题,我们提出一种新颖的演员与动作模块化网络,在两个独立模块中分别定位演员及其动作。具体而言,我们首先从视频和文本查询中学习演员/动作相关内容,然后以对称方式匹配它们以定位目标管(target tube)。目标管包含所需的演员与动作,随后被送入全卷积网络以预测演员的分割掩码。我们的方法还通过提出的时间提议聚合机制建立跨多帧的物体关联。这使我们的方法能有效分割视频并保持预测的时间一致性。整个模型支持演员-动作匹配与分割的联合学习,并在 A2D Sentences 与 J-HMDB Sentences 数据集上取得了单帧分割与完整视频分割的最先进(state-of-the-art)性能。

关键词

引用

@article{arxiv.2011.00786,
  title  = {Actor and Action Modular Network for Text-based Video Segmentation},
  author = {Jianhua Yang and Yan Huang and Kai Niu and Linjiang Huang and Zhanyu Ma and Liang Wang},
  journal= {arXiv preprint arXiv:2011.00786},
  year   = {2022}
}

备注

Accepted By IEEE Transactions on Image Processing