中文

缓解低层视觉幻觉问题需具备自我意识:数据库、模型与训练策略

计算机视觉与模式识别 2025-03-28 v2

摘要

多模态大语言模型的快速发展推动了视觉感知与理解能力的显著提升,将多个任务整合为单一的视觉问答框架。然而,这些模型容易产生幻觉,限制了其作为人工智能系统的可靠性。虽然自然语言处理和图像描述生成领域广泛研究了这一问题,但在低层视觉感知与理解(HLPU)任务中,尤其是图像质量评估任务中,仍缺乏深入调查。我们认为,这些幻觉源于模型缺乏明确的自我意识。为此,我们首先引入 HLPU 指令数据库,这是第一个专注于低层视觉任务幻觉的指令数据库。该数据库包含约 20 万问答对,并由四个子集组成,覆盖不同类型的指令。随后,我们提出 Self-Awareness Failure Elimination (SAFEQA) 模型,利用图像特征、显著区域特征和质量特征来提高模型在低层视觉任务中的感知与理解能力。进一步,我们提出增强自我意识偏好优化 (ESA-PO) 框架,以增加模型对知识边界的认知,从而减缓幻觉发生。最后,我们在低层视觉任务上进行了全面实验,结果表明,我们的方法显著提升了模型在这些任务中的自我意识,并有效减少了幻觉。值得注意的是,我们的方法在各种评估指标上都优于类似厂商的模型,提高了所提出模型的准确性和自我意识。

关键词

引用

@article{arxiv.2503.20673,
  title  = {Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy},
  author = {Yinan Sun and Xiongkuo Min and Zicheng Zhang and Yixuan Gao and Yuqin Cao and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2503.20673},
  year   = {2025}
}