MACAROON:训练具备主动参与感的视觉语言模型
计算与语言
2024-10-21 v2
摘要
大型视觉语言模型(LVLMs)虽擅长遵循指令并回应多样化问题,但总会对模糊或不可解答的问题生成详细回应,导致幻觉和偏见问题。因此,LVLMs必须主动与人类交互,以询问澄清或获取更多信息以获得更好的回应。本研究旨在将LVLMs从被动的答案提供者转变为主动的合作伙伴。我们首先建立了一个三层次的层级结构,用于衡量LVLMs对无效、模糊和可个人化问题的主动参与能力。利用该层级结构,我们通过GPT-4o和人类标注员创建了PIE(ProactIve Engagement Evaluation),包含853个跨六种细粒度问题类型的问题,这些问题由人类标注员验证并配有明确的度量指标。我们在benchmark上的评估表明,现有LVLMs的表现不佳,最佳的开源权重模型仅达到0.28的综合对齐率(AAR)。针对此情况,我们引入MACAROON,即自我想象对抗性参考优化(self-iMaginAtion for ContrAstive pReference OptimizatiON),该方法指示LVLMs自主为带有任务描述和人类精心设计准则的无标签问题生成对抗性响应对。然后,将自想象数据格式化用于条件强化学习。实验结果表明,MACAROON有效提升了LVLMs的主动参与能力(0.84 AAR),同时在通用任务上保持可 comparable的性能。
引用
@article{arxiv.2406.14137,
title = {MACAROON: Training Vision-Language Models To Be Your Engaged Partners},
author = {Shujin Wu and Yi R. Fung and Sha Li and Yixin Wan and Kai-Wei Chang and Heng Ji},
journal= {arXiv preprint arXiv:2406.14137},
year = {2024}
}
备注
The code will be made public at https://github.com/ShujinWu-0814/MACAROON