中文

PIC 第四届挑战赛:面向稠密视频描述的多特征编码与多头部解码语义辅助方法

计算机视觉与模式识别 2022-08-16 v3

摘要

稠密视频描述(DVC)任务旨在为单个视频中的多个事件生成带时间戳的描述。语义信息对于 DVC 的定位与描述均起着重要作用。我们提出一种基于编码-解码框架的语义辅助稠密视频描述模型。在编码阶段,我们设计了一个概念检测器以提取语义信息,随后将其与多模态视觉特征融合以充分表示输入视频。在解码阶段,我们设计了一个与定位和描述头部并行工作的分类头部,以提供语义监督。我们的方法在 DVC 评价指标下的 YouMakeup 数据集上取得显著提升,并在 PIC 第四届挑战赛的化妆稠密视频描述(MDVC)任务中取得高性能。

关键词

引用

@article{arxiv.2207.02583,
  title  = {PIC 4th Challenge: Semantic-Assisted Multi-Feature Encoding and Multi-Head Decoding for Dense Video Captioning},
  author = {Yifan Lu and Ziqi Zhang and Yuxin Chen and Chunfeng Yuan and Bing Li and Weiming Hu},
  journal= {arXiv preprint arXiv:2207.02583},
  year   = {2022}
}

备注

5 pages, 2 figures, report of PIC 4th Challenge Accepted by PIC'22 workshop