中文

Parrot:多语言视觉指令调优

计算机视觉与模式识别 2025-05-27 v3 人工智能 计算与语言 机器学习

摘要

多模态大语言模型(MLLM)如 GPT-4o 的快速发展标志着通用人工智能的一个重要步骤。现有方法通常通过监督式微调(SFT)将视觉编码器与 LLM 对齐,但这会导致其处理多语言能力随训练进程的退化。我们经验观察到,不平衡的 SFT 数据集(主要以英语为中心)由于多语言标记对齐失败,导致非英语语言性能下降。为此,我们提出了 PARROT(一种 novel 方法),利用文本指导在语言层面进行视觉标记对齐。PARROT 以多样化语言输入为条件,对视觉标记使用混合专家(Mixture-of-Experts, MoE)进行多语言标记对齐。通过计算初始视觉特征与文本嵌入之间的注意力,我们选择最相关的专家,将视觉标记转换为特定语言的表示。此外,我们引入了 Massive Multilingual Multimodal Benchmark(MMMB),一个包含 6 种语言、15 个类别和 12,000 个问题的新基准,用于评估多语言能力。PARROT 在多语言基准和广泛的多模态任务上均实现了最先进的性能。代码和数据集均可在 https://github.com/AIDC-AI/Parrot 获取。

关键词

引用

@article{arxiv.2406.02539,
  title  = {Parrot: Multilingual Visual Instruction Tuning},
  author = {Hai-Long Sun and Da-Wei Zhou and Yang Li and Shiyin Lu and Chao Yi and Qing-Guo Chen and Zhao Xu and Weihua Luo and Kaifu Zhang and De-Chuan Zhan and Han-Jia Ye},
  journal= {arXiv preprint arXiv:2406.02539},
  year   = {2025}
}

备注

Accepted to ICML 2025. Code and dataset are available at: https://github.com/AIDC-AI/Parrot