Stark:面向人格常识的社交长期多模态对话
计算与语言
2024-07-08 v1 计算机视觉与模式识别
摘要
人类在通过即时通讯工具进行对话时,常分享与个人经历相关的多种图片。然而,现有研究仅关注(1)单次会话中的图片分享行为,导致长期社交互动受限,以及(2)缺乏个性化图片分享行为。本文引入Stark,一个覆盖广泛社交人格、多模态格式、时间间隔和图片的大规模长期多模态对话数据集。为自动构建Stark,我们提出了一种新颖的多模态语境化框架Mcu,生成来自ChatGPT和我们提出的Plan-and-Execute图像对齐器的长期多模态对话。使用Stark,我们训练了一个表现出惊人视觉想象能力的多模态对话模型Ultron 7B。此外,我们在人类评估中展示了该数据集的有效性。我们将源代码和数据集公开 disponible。
引用
@article{arxiv.2407.03958,
title = {Stark: Social Long-Term Multi-Modal Conversation with Persona Commonsense Knowledge},
author = {Young-Jun Lee and Dokyong Lee and Junyoung Youn and Kyeongjin Oh and Byungsoo Ko and Jonghwan Hyeon and Ho-Jin Choi},
journal= {arXiv preprint arXiv:2407.03958},
year = {2024}
}
备注
Project website: https://stark-dataset.github.io