MAGID:生成合成多模态数据集的自动化流水线
计算与语言
2024-10-04 v2
摘要
多模态交互系统的发展受限于缺乏丰富的多模态(文本、图像)对话数据,而 LLM 需要大量此类数据。先前的方法通过检索图像来增强文本对话,这带来了隐私、多样性和质量方面的限制。在本工作中,我们提出了多模态增强生成图像对话(MAGID),这是一个用多样且高质量的图像增强纯文本对话的框架。随后,应用扩散模型生成相应的图像,确保与所识别的文本对齐。最后,MAGID 在图像描述生成模块(文本 LLM)和图像质量模块(处理美观度、图文匹配和安全性)之间引入了创新的反馈循环,二者协同工作以生成高质量的多模态对话。我们在三个对话数据集上将 MAGID 与其他 SOTA 基线进行了比较,使用了自动评估和人工评估。结果表明,MAGID 与基线相当或优于基线,在人工评估中有显著提升,尤其是在图像数据库较小的检索基线对比中表现突出。
引用
@article{arxiv.2403.03194,
title = {MAGID: An Automated Pipeline for Generating Synthetic Multi-modal Datasets},
author = {Hossein Aboutalebi and Hwanjun Song and Yusheng Xie and Arshit Gupta and Justin Sun and Hang Su and Igor Shalyminov and Nikolaos Pappas and Siffi Singh and Saab Mansour},
journal= {arXiv preprint arXiv:2403.03194},
year = {2024}
}