利用特征多样性实现化妆时序视频定位
计算机视觉与模式识别
2022-08-15 v1 人工智能
摘要
本技术报告介绍了MTVG任务的ACM MM 2022第四届Person in Context (PIC)挑战赛的季军方案。MTVG旨在基于文本描述在未剪辑视频中定位某步骤的时间边界。该任务的最大挑战在于化妆步骤细粒度的视频-文本语义。然而,当前方法主要使用基于动作的预训练模型提取视频特征。由于动作比化妆步骤更粗粒度,基于动作的特征不足以提供细粒度线索。为解决此问题,我们提出通过利用特征多样性来实现细粒度表示。具体而言,我们提出了一系列从特征提取、网络优化到模型集成的方案。最终,我们在MTVG竞赛中获得季军。
引用
@article{arxiv.2208.06179,
title = {Exploiting Feature Diversity for Make-up Temporal Video Grounding},
author = {Xiujun Shu and Wei Wen and Taian Guo and Sunan He and Chen Wu and Ruizhi Qiao},
journal= {arXiv preprint arXiv:2208.06179},
year = {2022}
}
备注
3st Place in PIC Makeup Temporal Video Grounding (MTVG) Challenge in ACM-MM 2022