语言模型能读懂YouTube短视频的笑点吗?
计算与语言
2024-04-02 v3 计算机视觉与模式识别
摘要
随着社交网络上短形式搞笑视频日益流行,AI模型理解这些视频以更好地与人类交流变得迫切。遗憾的是,以往的视频幽默数据集针对特定领域(如演讲或情景喜剧),且多聚焦于语言线索。我们从YouTube整理了一个含10K用户生成多模态搞笑视频的数据集,称为ExFunTube。利用带GPT-3.5的视频过滤流程,我们验证了语言与视觉元素均对幽默有贡献。过滤后,我们为每个视频标注搞笑时刻的时间戳与文字解释。我们的ExFunTube区别于现有数据集的独特之处在于,视频涵盖广泛领域与各类幽默,需对内容进行多模态理解。此外,我们开发了零样本视频到文本提示,以最大化大语言模型(LLMs)对视频幽默的理解。通过自动打分、解释质量实验与人工评估三种不同评价方法,我们表明我们的提示显著提升了LLMs的幽默解释能力。
引用
@article{arxiv.2310.14159,
title = {Can Language Models Laugh at YouTube Short-form Videos?},
author = {Dayoon Ko and Sangho Lee and Gunhee Kim},
journal= {arXiv preprint arXiv:2310.14159},
year = {2024}
}
备注
EMNLP 2023; references added