通过创建 LLM 对齐指令弥合视觉指令微调中的写作风格差异
人工智能
2025-03-25 v1 计算与语言
摘要
在大型多模态模型领域,视觉指令微调阶段的指令质量显著影响模态对齐的性能。在本文中,我们从一个被称为“写作风格”的独特视角评估指令质量,该视角涵盖了传达特定语义时的词汇选择、语法和句子结构。我们认为,在 LMMs 中,视觉指令与基础大型语言模型之间存在显著的写作风格差异。这种差异迫使预训练的基础 LLMs 偏离其原始写作风格,导致基础 LLMs 和 LMMs 的能力退化。为了在保留原始语义的同时弥合写作风格差异,我们提出直接利用基础 LLM 将软格式视觉指令的写作风格与基础 LLM 自身的写作风格对齐,从而生成新颖的 LLM 对齐指令。人工写作风格评估结果表明,我们的方法成功地将写作风格差异降至最低。通过利用 LLM 对齐指令,基线模型 LLaVA-7B 和 QwenVL 展现出更强的抗幻觉能力,并在所有 个视觉和语言基准测试中取得了显著的全面提升。
引用
@article{arxiv.2503.18320,
title = {Bridging Writing Manner Gap in Visual Instruction Tuning by Creating LLM-aligned Instructions},
author = {Dong Jing and Nanyi Fei and Zhiwu Lu},
journal= {arXiv preprint arXiv:2503.18320},
year = {2025}
}