中文

视觉去幻觉指令生成

计算机视觉与模式识别 2024-02-14 v1

摘要

近年来,生成式语言模型合成的视觉指令在视觉问答任务上展示了合理的文本生成性能。然而,生成式语言模型的幻觉问题仍然存在,即生成的图像-文本数据包含非预期内容。本文提出了一种新颖且可扩展的生成视觉去幻觉指令的方法,称为CAP2QA,该方法将范围限制为仅图像内容。我们的主要贡献在于引入了图像对齐的指令性QA数据集CAP2QA-COCO及其可扩展的方案。在我们的实验中,我们通过视觉指令微调比较了共享相同源数据的合成视觉指令数据集,并进行了通用视觉识别任务。结果表明,我们提出的方法显著减少了视觉幻觉,同时持续提高了视觉识别能力和表现力。

关键词

引用

@article{arxiv.2402.08348,
  title  = {Visually Dehallucinative Instruction Generation},
  author = {Sungguk Cha and Jusung Lee and Younghyun Lee and Cheoljong Yang},
  journal= {arXiv preprint arXiv:2402.08348},
  year   = {2024}
}

备注

Accepted in ICASSP2024