时序洞察增强:缓解多模态大语言模型中的时序幻觉
计算机视觉与模式识别
2024-01-19 v1 人工智能
摘要
多模态大语言模型(MLLMs)的最新进展显著增强了对多媒体内容的理解能力,将文本、图像和视频等不同模态结合在一起。然而,这些模型面临的一个关键挑战,特别是在处理视频输入时,是幻觉的出现——即错误感知或解释,尤其在事件层面。本研究引入了一种创新方法来解决 MLLMs 中的事件级幻觉,重点关注视频内容中的特定时序理解。我们的方法利用一个新颖的框架,从事件查询和提供的视频中提取并利用事件特定信息,以优化 MLLMs 的响应。我们提出了一种独特的机制,将按需事件查询分解为标志性动作。随后,我们使用 CLIP 和 BLIP2 等模型来预测事件发生的特定时间戳。我们使用 Charades-STA 数据集进行的评估表明,时序幻觉显著减少,且事件相关响应的质量得到提高。本研究不仅为解决 MLLMs 的关键局限性提供了新视角,还为在时序相关问题背景下评估 MLLMs 贡献了一种可定量测量的方法。
引用
@article{arxiv.2401.09861,
title = {Temporal Insight Enhancement: Mitigating Temporal Hallucination in Multimodal Large Language Models},
author = {Li Sun and Liuan Wang and Jun Sun and Takayuki Okatani},
journal= {arXiv preprint arXiv:2401.09861},
year = {2024}
}
备注
7 pages, 7 figures