TARS:用于 MLLMs 幻觉减少的 MinMax 标记自适应偏好策略
计算机视觉与模式识别
2026-04-06 v4
摘要
多模态大语言模型 (MLLMs) 容易产生幻觉,生成虽似合理但缺乏视觉依据的输出,这部分原因在于在静态偏好监督下进行直接偏好优化 (DPO) 会过度拟合到表面语言线索上。我们提出了 TARS,一种标记自适应偏好策略,将 DPO 重新表述为原则化的 min-max 优化问题。内层最大化 selectively 扰动视觉无关标记以诱导最坏情况分布性偏移,而外层最小化则强制与因果视觉信号保持一致,而非表面级模式。进一步地,一种新的谱聚类损失通过快速傅里叶变换 (FFT) 在频域正规化隐藏表示,保留全局语义结构而无需刚性的标记级对应。我们在多个幻觉基准测试中评估了 TARS。仅使用 4.8k 偏好样本而无需专家反馈,TARS 将幻觉率从 26.4% 降至 13.2%,认知得分从 2.5 降至 0.4,显著优于标准 DPO。值得注意的是,TARS 超过了 5 倍基于 LLM 的数据增强(Hal-Rate: 16.0% vs. 13.2%),其中使用 28.8k 样本训练,表明通过对抗标记扰动重新塑造优化景观在本质上比扩大训练数据更有效。TARS 还缩小了与 GPT-4o 在关键指标上的差距。
引用
@article{arxiv.2507.21584,
title = {TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs},
author = {Kejia Zhang and Keda Tao and Zhiming Luo and Chang Liu and Jiasheng Tang and Huan Wang},
journal= {arXiv preprint arXiv:2507.21584},
year = {2026}
}