中文

语言模型能读懂YouTube短视频的笑点吗?

计算与语言 2024-04-02 v3 计算机视觉与模式识别

摘要

随着社交网络上短形式搞笑视频日益流行,AI模型理解这些视频以更好地与人类交流变得迫切。遗憾的是,以往的视频幽默数据集针对特定领域(如演讲或情景喜剧),且多聚焦于语言线索。我们从YouTube整理了一个含10K用户生成多模态搞笑视频的数据集,称为ExFunTube。利用带GPT-3.5的视频过滤流程,我们验证了语言与视觉元素均对幽默有贡献。过滤后,我们为每个视频标注搞笑时刻的时间戳与文字解释。我们的ExFunTube区别于现有数据集的独特之处在于,视频涵盖广泛领域与各类幽默,需对内容进行多模态理解。此外,我们开发了零样本视频到文本提示,以最大化大语言模型(LLMs)对视频幽默的理解。通过自动打分、解释质量实验与人工评估三种不同评价方法,我们表明我们的提示显著提升了LLMs的幽默解释能力。

关键词

引用

@article{arxiv.2310.14159,
  title  = {Can Language Models Laugh at YouTube Short-form Videos?},
  author = {Dayoon Ko and Sangho Lee and Gunhee Kim},
  journal= {arXiv preprint arXiv:2310.14159},
  year   = {2024}
}

备注

EMNLP 2023; references added