中文

大型语言、图像、视频和音频基础模型幻觉问题综合调查

机器学习 2024-10-04 v4 人工智能 计算与语言 计算机视觉与模式识别 声音 音频与语音处理

摘要

基础模型(FMs)在语言、图像、音频和视频领域的快速发展展现出在多样化任务中的卓越能力。然而,基础模型的普及带来了一个关键挑战:在高风险应用中生成幻觉输出的潜在风险。基础模型产生幻觉内容的倾向性或许是其在现实场景中广泛采纳的最大障碍,尤其是在可靠性和准确性至关重要的领域。本综述论文提供了最新发展的全面概述,旨在识别和缓解基础模型中幻觉问题,涵盖文本、图像、视频和音频多种模态。通过综合不同模态中检测和缓解幻觉的最新进展,本文旨为研究人员、开发人员和实践者提供有价值的见解。本文基本上建立了一个清晰的框架,涵盖幻觉的定义、分类和检测策略,以解决多模态基础模型中的幻觉问题,为该关键领域的未来研究奠定了基础。

关键词

引用

@article{arxiv.2405.09589,
  title  = {A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Models},
  author = {Pranab Sahoo and Prabhash Meharia and Akash Ghosh and Sriparna Saha and Vinija Jain and Aman Chadha},
  journal= {arXiv preprint arXiv:2405.09589},
  year   = {2024}
}

备注

EMNLP 2024 Findings