通过自增对比对齐缓解多模态 LLM 中的对象与动作幻觉
计算机视觉与模式识别
2025-12-05 v1 人工智能
计算与语言
机器学习
摘要
近期多模态 LLM(MLLM)的快速发展使其在生成输入视频描述方面表现突出,但这些模型在生成描述中常出现事实性错误,导致严重的幻觉问题。虽然已有工作探索了缓解静态图像幻觉的方法,但在动态视频上联合缓解视觉对象和时间动作幻觉仍是具有挑战性且尚未解决的难题。为此,我们提出一种 Self-Augmented Contrastive Alignment(SANTA)框架,通过豁免虚假关联并强化对视觉事实的关注来实现对象和动作忠实性。SANTA 采用幻觉自增强方案识别 MLLM 中的潜在幻觉,并将原始描述转化为对照负样本。此外,我们开发了轨迹短语对比对齐,以匹配区域对象和关系引导的动作与其对应的视觉和时间短语。大量实验表明,SANTA 在缓解对象和动作幻觉方面优于现有方法,在幻觉检测基准测试中取得优异性能。
引用
@article{arxiv.2512.04356,
title = {Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment},
author = {Kai-Po Chang and Wei-Yuan Cheng and Chi-Pin Huang and Fu-En Yang and Yu-Chiang Frank Wang},
journal= {arXiv preprint arXiv:2512.04356},
year = {2025}
}
备注
IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026. Project page: https://kpc0810.github.io/santa/