中文

基于对比预训练的评论辅助视频-语言对齐用于短视频幽默检测

计算机视觉与模式识别 2024-04-16 v3 人工智能

摘要

多模态幽默检测在情感计算中日益增长的重要性与短视频分享在社交媒体平台上日益扩大的影响力密切相关。本文提出了一种新颖的用于短视频幽默检测(SVHD)的双分支层次模型,名为通过数据增强多模态对比预训练的评论辅助视频-语言对齐(CVLA)。值得注意的是,我们的 CVLA 不仅处理跨多种模态通道的原始信号,还通过在一致的语义空间中对齐视频和语言成分,产生适当的多模态表示。在两个幽默检测数据集(包括 DY11k 和 UR-FUNNY)上的实验结果表明,CVLA 显著优于最先进的方法和多个有竞争力的基线方法。我们的数据集、代码和模型发布于 https://github.com/yliu-cs/CVLA。

关键词

引用

@article{arxiv.2402.09055,
  title  = {Comment-aided Video-Language Alignment via Contrastive Pre-training for Short-form Video Humor Detection},
  author = {Yang Liu and Tongfei Shen and Dong Zhang and Qingying Sun and Shoushan Li and Guodong Zhou},
  journal= {arXiv preprint arXiv:2402.09055},
  year   = {2024}
}

备注

Accepted by ICMR 2024