ARMADA:基于属性的多模态数据增强
人工智能
2024-08-20 v1
摘要
在多模态语言模型(MLM)中,手动标注高质量图像-文本配对数据以进行微调和对齐的成本极高。虽然现有的多模态数据增强框架提出了增强图像-文本配对的方法,但它们要么 suffer from 文本与图像之间的语义不一致,要么生成不真实的图像,从而与真实世界示例产生知识差距。为解决这些问题,我们提出了基于属性的多模态数据增强(ARMADA),这是一种通过知识引导的视觉属性操作来生成多模态数据的新方法。具体而言,我们从原始文本数据中提取实体及其视觉属性,然后在知识库(KB)和大语言模型(LLM)的引导下搜索视觉属性的替代值。随后我们利用图像编辑模型使用提取的属性来编辑图像。ARMADA 是一个新颖的多模态数据生成框架,它:(i) 从符号化知识库中提取知识驱动的属性,以生成语义一致且具有区分性的图像-文本配对,(ii) 利用知识库层次结构中的邻近实体生成不同类别但视觉上相似的图像,以及(iii) 利用大语言模型的常识知识来调节辅助视觉属性(如背景),从而更鲁棒地表示原始实体。我们在四个下游任务上的实证结果证明了我们的框架在生成高质量数据和增强模型性能方面的有效性。这也凸显了利用外部知识代理来增强可解释性和现实世界锚定的必要性。
引用
@article{arxiv.2408.10086,
title = {ARMADA: Attribute-Based Multimodal Data Augmentation},
author = {Xiaomeng Jin and Jeonghwan Kim and Yu Zhou and Kuan-Hao Huang and Te-Lin Wu and Nanyun Peng and Heng Ji},
journal= {arXiv preprint arXiv:2408.10086},
year = {2024}
}