中文

MAGID:生成合成多模态数据集的自动化流水线

计算与语言 2024-10-04 v2

摘要

多模态交互系统的发展受限于缺乏丰富的多模态(文本、图像)对话数据,而 LLM 需要大量此类数据。先前的方法通过检索图像来增强文本对话,这带来了隐私、多样性和质量方面的限制。在本工作中,我们提出了多模态增强生成图像对话(MAGID),这是一个用多样且高质量的图像增强纯文本对话的框架。随后,应用扩散模型生成相应的图像,确保与所识别的文本对齐。最后,MAGID 在图像描述生成模块(文本 LLM)和图像质量模块(处理美观度、图文匹配和安全性)之间引入了创新的反馈循环,二者协同工作以生成高质量的多模态对话。我们在三个对话数据集上将 MAGID 与其他 SOTA 基线进行了比较,使用了自动评估和人工评估。结果表明,MAGID 与基线相当或优于基线,在人工评估中有显著提升,尤其是在图像数据库较小的检索基线对比中表现突出。

关键词

引用

@article{arxiv.2403.03194,
  title  = {MAGID: An Automated Pipeline for Generating Synthetic Multi-modal Datasets},
  author = {Hossein Aboutalebi and Hwanjun Song and Yusheng Xie and Arshit Gupta and Justin Sun and Hang Su and Igor Shalyminov and Nikolaos Pappas and Siffi Singh and Saab Mansour},
  journal= {arXiv preprint arXiv:2403.03194},
  year   = {2024}
}