用于化妆时序视频定位的双路径时间图优化
计算机视觉与模式识别
2023-09-13 v1 多媒体
摘要
化妆时序视频定位(Make-up Temporal Video Grounding, MTVG)旨在给定长视频时,定位与描述化妆活动的句子在语义上相关的目标视频片段。相较于通用视频定位任务,MTVG 关注面部上细致的动作与变化。化妆指导步骤通常涉及产品与面部区域的细致差异,比通用活动(如烹饪活动与家具组装)更为细粒度。因此,现有通用方法无法有效定位目标活动。更具体地,现有提案生成模块在为更细粒度的化妆语义理解提供语义线索方面尚不完善。为解决此问题,我们提出一种高效的基于提案的框架,称为双路径时间图优化网络(Dual-Path Temporal Map Optimization Network, DPTMO),以捕获化妆活动的细粒度多模态语义细节。DPTMO 提取查询无关与查询引导两类特征构建两个提案集,并对两集使用特定评估方法。与以往方法常用的单一结构不同,我们的双路径结构能挖掘化妆视频中更多语义信息并很好区分细粒度动作。这两组候选集分别代表跨模态化妆视频-文本相似度与多模态融合关系,互为补充。每集对应各自的优化视角,其联合预测提升了视频时间戳预测的准确性。在 YouMakeup 数据集上的综合实验表明,我们提出的双结构在细粒度语义理解上表现优异。
引用
@article{arxiv.2309.06176,
title = {Dual-Path Temporal Map Optimization for Make-up Temporal Video Grounding},
author = {Jiaxiu Li and Kun Li and Jia Li and Guoliang Chen and Dan Guo and Meng Wang},
journal= {arXiv preprint arXiv:2309.06176},
year = {2023}
}