TikTalk:面向真实世界多模态闲聊的基于视频的对话数据集
计算与语言
2023-09-11 v3 人工智能
摘要
为了促进具有多模态上下文的智能且拟人化聊天机器人的研究,我们引入了一个新的基于视频的多模态对话数据集,称为 TikTalk。我们从一个流行的视频分享平台收集了 38K 个视频,以及用户在其下方发布的 367K 条对话。用户基于观看视频的多模态体验进行自发对话,这有助于重现真实世界的闲聊上下文。与以往的多模态对话数据集相比,TikTalk 中更丰富的上下文类型带来了更多样化的对话,但也增加了从复杂的多模态信息中捕捉人类兴趣以生成个性化回复的难度。此外,在我们的数据集中更频繁地唤起了外部知识。这些事实揭示了多模态对话模型面临的新挑战。我们定量地展示了 TikTalk 的特征,提出了一个基于视频的多模态闲聊任务,并评估了几个对话基线。实验结果表明,结合大语言模型(LLM)的模型可以生成更多样化的回复,而利用知识图谱引入外部知识的模型总体表现最佳。此外,没有现有模型能够很好地解决上述所有挑战。即使对于带有视觉扩展的 LLM,未来仍有很大的改进空间。我们的数据集可在 \url{https://ruc-aimind.github.io/projects/TikTalk/} 获取。
引用
@article{arxiv.2301.05880,
title = {TikTalk: A Video-Based Dialogue Dataset for Multi-Modal Chitchat in Real World},
author = {Hongpeng Lin and Ludan Ruan and Wenke Xia and Peiyu Liu and Jingyuan Wen and Yixin Xu and Di Hu and Ruihua Song and Wayne Xin Zhao and Qin Jin and Zhiwu Lu},
journal= {arXiv preprint arXiv:2301.05880},
year = {2023}
}
备注
Accepted to ACM Multimedia 2023