面向实时场景理解的反馈增强型防幻觉视觉语言模型
机器学习
2025-04-08 v1
摘要
实时场景理解是人工智能的关键进步,正在提升机器人、监视和辅助工具的能力。然而,幻觉仍是一个挑战。AI 系统常对视觉输入产生误解,检测不存在的物体或描述从未发生的事件。这些错误远非小题,对于安全和自主导航等关键领域的可靠性构成威胁。我们的解决方案通过嵌入自我意识来应对这一问题。不信任初始输出,而是实时持续评估它们,动态调整置信度阈值。当确定性低于可靠基准时,抑制不可靠的主张。将 YOLOv5 的目标检测优势与 VILA1.5-3B 的受控语言生成相结合,将描述与确认的视觉数据绑定在一起。优势包括动态阈值调谐以提高准确性、基于证据的文本以减少幻觉,以及以 18 帧/秒的实时性能。这种反馈驱动的设计比传统方法减少 37% 的幻觉。快速、灵活且可靠,尤其适用于从机器人导航到安全监控的各种应用,使 AI 感知与现实保持一致。
引用
@article{arxiv.2504.04772,
title = {Feedback-Enhanced Hallucination-Resistant Vision-Language Model for Real-Time Scene Understanding},
author = {Zahir Alsulaimawi},
journal= {arXiv preprint arXiv:2504.04772},
year = {2025}
}