EACO:通过关键观察提升多模态 LLM 对齐性
计算机视觉与模式识别
2024-12-17 v2 人工智能
计算与语言
机器学习
摘要
多模态大语言模型(MLLMs)在利用针对 various 视觉问答和推理任务进行的指令微调方面取得了显著进展。它们还可以从由人类标注的偏好数据中学习,以增强推理能力并缓解幻觉现象。大多数偏好数据是由模型自身生成的。然而,现有方法需要高质量的关键标签,这些标签成本高昂且依赖人类或像 GPT-4V 这样的专有模型。在本工作中,我们提出了通过关键观察(Critical Observation)来增强 MLLM 对齐性(EACO),该方法仅使用 5k 张图片即可通过自生成的偏好数据实现对齐。我们的方法首先收集和细化一个评分评估指令微调数据集,以训练一个关键评估模型,称为 Critic。该 Critic 观察模型在多个维度上的响应,选择优先和非优先输出以进行精炼后的直接偏好优化(DPO)调优。为进一步提升模型性能,我们在偏好调优后采用额外的监督式微调阶段。EACO 在 HallusionBench 上将整体幻觉降低 65.6%,在 MME-Cognition 上提升推理能力 21.8%。EACO 在多个基准测试中相对于 LLaVA-v1.6-Mistral-7B 获得 8.5% 的改进。值得注意的是,EACO 也显示出在开源 MLLMs 中发挥关键能力的潜力,表明 EACO 是提升 MLLM 能力的可行路径。
引用
@article{arxiv.2412.04903,
title = {EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation},
author = {Yongxin Wang and Meng Cao and Haokun Lin and Mingfei Han and Liang Ma and Jin Jiang and Yuhao Cheng and Xiaodan Liang},
journal= {arXiv preprint arXiv:2412.04903},
year = {2024}
}
备注
19 pages