PIC 第四届挑战赛:面向稠密视频描述的多特征编码与多头部解码语义辅助方法
计算机视觉与模式识别
2022-08-16 v3
摘要
稠密视频描述(DVC)任务旨在为单个视频中的多个事件生成带时间戳的描述。语义信息对于 DVC 的定位与描述均起着重要作用。我们提出一种基于编码-解码框架的语义辅助稠密视频描述模型。在编码阶段,我们设计了一个概念检测器以提取语义信息,随后将其与多模态视觉特征融合以充分表示输入视频。在解码阶段,我们设计了一个与定位和描述头部并行工作的分类头部,以提供语义监督。我们的方法在 DVC 评价指标下的 YouMakeup 数据集上取得显著提升,并在 PIC 第四届挑战赛的化妆稠密视频描述(MDVC)任务中取得高性能。
引用
@article{arxiv.2207.02583,
title = {PIC 4th Challenge: Semantic-Assisted Multi-Feature Encoding and Multi-Head Decoding for Dense Video Captioning},
author = {Yifan Lu and Ziqi Zhang and Yuxin Chen and Chunfeng Yuan and Bing Li and Weiming Hu},
journal= {arXiv preprint arXiv:2207.02583},
year = {2022}
}
备注
5 pages, 2 figures, report of PIC 4th Challenge Accepted by PIC'22 workshop