利用损坏的定位数据预训练多模态幻觉检测器
计算与语言
2024-09-04 v1 计算机视觉与模式识别
摘要
多模态语言模型在其输出中可能出现幻觉,这限制了它们的可靠性。自动检测这些错误的能力对于缓解幻觉至关重要,但相关探索较少,且现有工作并未定位幻觉,而是将其视为一个分类任务。在本工作中,我们首先将多模态幻觉检测定义为一个序列标注任务,模型必须定位幻觉文本片段,并提出了一个强大的基线模型。鉴于该任务人工标注成本高昂,我们提出了一种通过创建损坏的定位数据来提升模型样本效率的方法,并将其用于预训练。我们利用短语定位数据,生成幻觉来替换已定位的片段,从而创建幻觉文本。实验表明,在此数据上进行预训练能提升微调时的样本效率,并且来自定位数据的学习信号在这些改进中扮演了重要角色。
引用
@article{arxiv.2409.00238,
title = {Pre-Training Multimodal Hallucination Detectors with Corrupted Grounding Data},
author = {Spencer Whitehead and Jacob Phillips and Sean Hendryx},
journal= {arXiv preprint arXiv:2409.00238},
year = {2024}
}