看、说与分割:教导大型多模态模型克服错误前提
计算机视觉与模式识别
2023-12-14 v1
摘要
当前的开源大型多模态模型(LMM)在开放词汇语言定位与分割等任务中表现出色,但当查询暗示存在图像中实际并不存在的事物时,可能会受到错误前提的影响。我们观察到,对 LMM 进行微调以分割图像的现有方法会显著降低其可靠判断(“看”)物体是否存在以及与人类自然交互(“说”)的能力,这是一种灾难性遗忘的形式。在本工作中,我们提出了一种用于 LMM 的级联联合训练方法来解决这一任务,避免了对先前技能的灾难性遗忘。我们得到的模型能够通过检测物体是否存在于图像中来“看”,通过告知用户物体是否存在、提出替代查询或纠正查询中的语义错误来“说”,并最终在物体存在时通过输出目标物体的掩码来进行“分割”。此外,我们引入了一个新颖的错误前提纠正基准数据集,作为现有 RefCOCO(+/g) 指称分割数据集的扩展(我们称之为 FP-RefCOCO(+/g))。结果表明,我们的方法不仅检测错误前提的能力比现有方法最高提升 55%,而且在错误前提条件下,相较于基线产生了超过 31% 的相对 cIOU 提升,并在高达 67% 的情况下产生了被判定为有帮助的自然语言反馈。
引用
@article{arxiv.2312.08366,
title = {See, Say, and Segment: Teaching LMMs to Overcome False Premises},
author = {Tsung-Han Wu and Giscard Biamby and David Chan and Lisa Dunlap and Ritwik Gupta and Xudong Wang and Joseph E. Gonzalez and Trevor Darrell},
journal= {arXiv preprint arXiv:2312.08366},
year = {2023}
}
备注
Project Page: https://see-say-segment.github.io