中文

DialogCC:一种用于创建高质量多模态对话数据集的自动化流水线

计算机视觉与模式识别 2024-04-01 v2 计算与语言

摘要

由于在即时消息中分享图像是关键因素,关于图像-文本多模态对话模型的学习已有活跃研究。然而,由于现有多模态对话数据集中每轮对话图像质量低且多样性有限,训练具有良好泛化能力的多模态对话模型仍具挑战。本文提出一种自动化流水线以构建多模态对话数据集,在无需最少人工介入的情况下确保对话质量与图像多样性。在我们的流水线中,为保证图像与对话间的连贯性,我们提示GPT-4推断潜在的图像分享时刻——具体为话语、说话者、理由与图像描述。此外,我们利用CLIP相似度维持对齐到该话语的多张图像间的一致性。通过该流水线,我们推出DialogCC,一个在人工评估中质量与多样性均超越现有数据集的高质量、多样化多模态对话数据集。我们的综合实验强调,当多模态对话模型使用我们的数据集训练时,其在未见对话数据集上的泛化性能显著提升。我们公开了源代码与数据集。

关键词

引用

@article{arxiv.2212.04119,
  title  = {DialogCC: An Automated Pipeline for Creating High-Quality Multi-Modal Dialogue Dataset},
  author = {Young-Jun Lee and Byungsoo Ko and Han-Gyu Kim and Jonghwan Hyeon and Ho-Jin Choi},
  journal= {arXiv preprint arXiv:2212.04119},
  year   = {2024}
}

备注

NAACL 2024