中文

SMILE:利用语言模型理解视频中笑声的多模态数据集

计算与语言 2024-05-27 v3 人工智能

摘要

尽管人工智能近期取得了进展,构建社交智能仍然是一个挑战。在社交信号中,笑声是人类社交互动中出现的独特表达之一。在本研究中,我们着手应对机器理解视频中笑声背后原理的新挑战,即视频笑因推理。我们引入了这一新任务,旨在解释人们为何在特定视频中发笑,并为该任务提供了一个数据集。我们提出的数据集 SMILE 包含视频片段以及关于人们为何发笑的语言描述。我们通过利用大语言模型(LLM)的推理能力与文本视频表示,提出了一个基线方法。实验表明,我们的基线方法能够为笑声生成合理的解释。我们通过探索其他视频理解任务和自然视频,进一步研究了基线方法的可扩展性。我们在 https://github.com/postech-ami/SMILE-Dataset 上发布了我们的数据集、代码和模型检查点。

关键词

引用

@article{arxiv.2312.09818,
  title  = {SMILE: Multimodal Dataset for Understanding Laughter in Video with Language Models},
  author = {Lee Hyun and Kim Sung-Bin and Seungju Han and Youngjae Yu and Tae-Hyun Oh},
  journal= {arXiv preprint arXiv:2312.09818},
  year   = {2024}
}

备注

19 pages, 14 figures