故事之声:带音频的多模态讲故事
多媒体
2023-10-31 v1 声音
音频与语音处理
摘要
在现实世界中,讲故事是多模态的。当一个人讲述故事时,可能会同时使用所有的可视化内容与声音以及故事本身。然而,尽管声音也传达了故事的有意义语义,先前关于讲故事数据集与任务的研究却很少关注声音。因此,我们提议通过建立一个称为“背景声音”的新组件来拓展故事理解与讲述领域,这是一种基于故事上下文、不含任何语言信息的音频。为此,我们引入了一个称为“故事之声(Sound of Story, SoS)”的新数据集,其包含配对的图像与文本序列,以及故事对应的声音或背景音乐。据我们所知,这是用于带声音讲故事的最大精心整理的数据集。我们的 SoS 数据集包含 27,354 个故事,每个故事平均 19.6 张图像,以及 984 小时与语音解耦的音频(如背景音乐与其他声音)。作为带声音讲故事及该数据集的基准任务,我们提出了模态间的检索任务,以及由图像-文本序列生成音频的任务,并为之引入了强基线。我们相信所提出的数据集与任务可从声音角度启发对讲故事的多模态理解。各任务的数据集与基线代码下载链接将发布于:https://github.com/Sosdatasets/SoS_Dataset。
引用
@article{arxiv.2310.19264,
title = {Sound of Story: Multi-modal Storytelling with Audio},
author = {Jaeyeon Bae and Seokhoon Jeong and Seokun Kang and Namgi Han and Jae-Yon Lee and Hyounghun Kim and Taehwan Kim},
journal= {arXiv preprint arXiv:2310.19264},
year = {2023}
}
备注
Findings of EMNLP 2023, project: https://github.com/Sosdatasets/SoS_Dataset/