SchröMind:通过求解薛定谔桥问题缓解多模态大语言模型中的幻觉
计算机视觉与模式识别
2026-02-11 v1
摘要
多模态大语言模型的最新进展已在各个领域取得了显著成功。然而,由于持续存在的幻觉(即生成的文本与视觉输入相矛盾或忽略视觉输入),它们在医疗保健等高风险领域的应用仍然有限。我们认为,多模态大语言模型能够理解图像,但难以生成准确的 token 序列。微小的扰动可能会将注意力从真实状态转移到不真实状态,而文本生成的自回归特性通常阻止了错误纠正。为解决此问题,我们提出了 SchröMind——一种通过求解薛定谔桥问题来减少幻觉的新颖框架。它通过轻量级训练,以最小的传输代价在幻觉激活和真实激活之间建立 token 级别的映射,同时保留模型的原始能力。在 POPE 和 MME 基准上的大量实验证明了 Schrödinger 的优越性,它在引入极小的计算开销的同时实现了最先进的性能。
引用
@article{arxiv.2602.09528,
title = {Schr\"oMind: Mitigating Hallucinations in Multimodal Large Language Models via Solving the Schr\"odinger Bridge Problem},
author = {Ziqiang Shi and Rujie Liu and Shanshan Yu and Satoshi Munakata and Koichi Shirahata},
journal= {arXiv preprint arXiv:2602.09528},
year = {2026}
}
备注
ICASSP 2026