中文

语义概念引导的集合预测用于多样化视频描述

计算机视觉与模式识别 2024-01-01 v1

摘要

多样化视频描述旨在生成一组句子,从各个方面描述给定的视频。主流方法使用视频与其真值集中某个描述组成的独立对进行训练,而未利用集合内部的关系,导致生成的描述多样性较低。与之不同,我们将多样化描述表述为语义概念引导的集合预测 (SCG-SP) 问题,通过将预测的描述集合拟合到真值集合,从而充分捕捉集合层面的关系。具体而言,我们的集合预测包含两个协同任务,即描述生成和作为辅助任务的概念组合预测,后者提供额外的语义监督。集合中的每个描述都附有一个概念组合,指示该描述的主要语义内容,并促进集合预测中的元素对齐。此外,我们在概念上应用了多样性正则化项,以鼓励模型生成具有各种概念组合的语义多样化描述。这两个任务共享多个特定语义的编码作为输入,这些编码是通过视觉特征与概念查询之间的迭代交互获得的。生成的描述与特定概念组合之间的对应关系进一步保证了我们模型的可解释性。在基准数据集上的大量实验表明,所提出的 SCG-SP 在相关性和多样性指标下均达到了最先进 (SOTA) 的性能。

关键词

引用

@article{arxiv.2312.15720,
  title  = {Set Prediction Guided by Semantic Concepts for Diverse Video Captioning},
  author = {Yifan Lu and Ziqi Zhang and Chunfeng Yuan and Peng Li and Yan Wang and Bing Li and Weiming Hu},
  journal= {arXiv preprint arXiv:2312.15720},
  year   = {2024}
}

备注

aaai 2024 accepted