中文

基于 Polite Flamingo 的视觉指令微调

计算机视觉与模式识别 2023-12-19 v2 计算与语言

摘要

近期研究表明,使用多种标注的下游视觉-语言数据集对多模态大语言模型(LLM)进行多任务微调可显著提升其性能。然而,在此过程中会出现一种我们称之为“多模态对齐代价”的副作用。由于原始标注过于简略且无格式,该副作用会负面影响模型对回复进行恰当格式化(例如其“礼貌性”)的能力,导致人类偏好降低。本文提出 Polite Flamingo,一种多模态回复改写器,可将原始标注转化为更具吸引力、“礼貌”的格式。Polite Flamingo 被训练用于从其自动失真对应样本中重建高质量回复,随后应用于大量视觉-语言数据集进行回复改写。经严格过滤,我们生成 PF-1M 数据集,并通过使用该数据集微调多模态 LLM 进一步验证其价值。结合包括 U 形多阶段微调与多轮增强在内的新方法,所得模型 Clever Flamingo 在自动与人工评估中均展现出多模态理解与回复礼貌性方面的优势。

关键词

引用

@article{arxiv.2307.01003,
  title  = {Visual Instruction Tuning with Polite Flamingo},
  author = {Delong Chen and Jianfeng Liu and Wenliang Dai and Baoyuan Wang},
  journal= {arXiv preprint arXiv:2307.01003},
  year   = {2023}
}

备注

In AAAI-24