ResNetVLLM-2:解决 ResNetVLLM 的多模态幻觉问题
计算机视觉与模式识别
2025-04-22 v1 人工智能
摘要
大语言模型(LLM)已彻底变革自然语言处理(NLP)任务,但它们存在幻觉问题,即生成看似合理却事实错误的内容。这一问题也延伸至视频语言模型(VideoLLM),其中文本描述可能不准确地代表视觉内容,导致多模态幻觉。在本文中,我们针对 ResNetVLLM——一种结合 ResNet 视觉编码器与 LLM 的视频语言模型——解决幻觉问题。我们引入两步协议:(1)一种信效度检测策略,利用修改版 Lynx 模型评估生成的标题与真实视频参考之间的语义对齐程度;(2)一种幻觉缓解策略,通过检索增强生成(RAG)实现,动态构建推理期间使用的知识库。我们增强后的模型 ResNetVLLM-2 通过对生成内容与外部知识进行交叉验证,从而降低了多模态幻觉,提高了事实一致性。在 ActivityNet-QA 基准测试中,实验结果显示,其准确率从 54.8% 提升至 65.3%,突出了我们幻觉检测与缓解策略在提升视频语言模型可靠性方面的有效性。
关键词
引用
@article{arxiv.2504.14429,
title = {ResNetVLLM-2: Addressing ResNetVLLM's Multi-Modal Hallucinations},
author = {Ahmad Khalil and Mahmoud Khalil and Alioune Ngom},
journal= {arXiv preprint arXiv:2504.14429},
year = {2025}
}