中文

HalluciDoctor:缓解视觉指令数据中的幻觉毒性

计算机视觉与模式识别 2024-03-26 v2 人工智能

摘要

在多模态机器生成指令跟随数据上微调的多模态大语言模型(MLLMs)已在各种多模态理解与生成任务中展现出卓越性能。然而,机器生成数据固有的幻觉(可能导致MLLMs产生幻觉输出)仍未被充分探索。本工作旨在研究各种幻觉(即对象、关系、属性幻觉)并缓解大规模机器生成视觉指令数据集中的那些幻觉毒性。借鉴人类识别事实错误的能力,我们提出一种基于交叉检验范式的新型幻觉检测与消除框架HalluciDoctor。我们使用该框架自动识别并消除训练数据中的幻觉。有趣的是,HalluciDoctor还表明,由长尾对象共现引起的虚假关联导致了幻觉。基于此,我们执行反事实视觉指令扩展以平衡数据分布,从而增强MLLMs对幻觉的抵抗能力。在幻觉评估基准上的综合实验表明,我们的方法相对缓解了44.6%的幻觉,并维持了与LLaVA相竞争的性能。本文的数据和代码已公开可用。\url{https://github.com/Yuqifan1117/HalluciDoctor}。

关键词

引用

@article{arxiv.2311.13614,
  title  = {HalluciDoctor: Mitigating Hallucinatory Toxicity in Visual Instruction Data},
  author = {Qifan Yu and Juncheng Li and Longhui Wei and Liang Pang and Wentao Ye and Bosheng Qin and Siliang Tang and Qi Tian and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2311.13614},
  year   = {2024}
}

备注

Accepted by CVPR 2024