中文

grounding还是猜测?基于视觉信号的手语翻译 hallucination 检测

计算与语言 2026-01-29 v2

摘要

幻觉(hallucination)问题在视觉语言模型中广泛存在,模型生成的文本缺乏视觉依据支持,在手语翻译(Sign Language Translation, SLT)中尤为关键。SLT中,意义依赖于对视频的精确 grounding,无 gloss 模型尤为脆弱,因为它们直接将签字手势连续性映射到自然语言,而无中间 gloss 监督作为对齐。我们认为,幻觉源于模型依赖语言先验而非视觉输入。为捕捉这一点,我们提出一种标记级可靠性度量,用于量化解码器使用视觉信息的程度。该方法结合基于特征的灵敏度(测量视频遮蔽时内部变化)和反事实信号(捕捉干净输入与人为修改输入之间的概率差异),将这些信号聚合为句子级可靠性分数,提供一种紧凑且可解释的视觉 grounding 度量。我们在两个SLT基准数据集(PHOENIX-2014T和CSL-Daily)上评估了该度量,包括基于gloss和无gloss模型。我们的结果表明,可靠性预测了幻觉率,跨数据集和架构普遍适用,且在视觉退化下呈现下降趋势。除了这些定量趋势,我们还发现,可靠性能够区分grounding的标记和猜测的标记,允许无参考的情况下估计风险;当结合基于文本的信号(置信度、perplexity或entropy)时,进一步提高了幻觉风险估计。定性分析突出了无gloss模型更易产生幻觉的原因。综上所述,我们的发现确立了可靠性作为诊断SLT幻觉的实用且可复用的工具,为更稳健的幻觉检测奠定了基础。

关键词

引用

@article{arxiv.2510.18439,
  title  = {Grounding or Guessing? Visual Signals for Detecting Hallucinations in Sign Language Translation},
  author = {Yasser Hamidullah and Koel Dutta Chowdhury and Yusser Al Ghussin and Shakib Yazdani and Cennet Oguz and Josef van Genabith and Cristina España-Bonet},
  journal= {arXiv preprint arXiv:2510.18439},
  year   = {2026}
}

备注

Accepted at ICLR2026