中文

何时信任答案:面向更安全手术视觉问答的问题对齐语义最近邻熵

计算机视觉与模式识别 2026-04-24 v2 人工智能

摘要

安全性与可靠性对于在手术中部署视觉问答(VQA)系统至关重要,因为错误或含糊的回答可能对患者造成伤害。现有不确定性估计方法(如语义最近邻熵 SNNE)的一个关键局限在于,它们并未显式地考虑条件问题。因此,它们可能对那些语义一致但与临床问题不对齐的回答赋予高置信度,尤其是在问题措辞发生变化时。我们提出问题对齐语义最近邻熵(QA-SNNE),一种通过双向门控将问题-答案对齐纳入语义熵的黑箱不确定性估计器。QA-SNNE 通过根据采样答案与问题的相关性对其两两语义相似度进行加权来度量不确定性,采用基于嵌入、基于蕴含或交叉编码器的对齐策略。为了评估其对语言变化的鲁棒性,我们构建了一个基准手术 VQA 数据集的“模板外改写”版本,其中仅修改问题措辞,而图像与真实答案保持不变。我们在两个基准手术 VQA 数据集上、跨五种 VQA 模型、在零样本与参数高效微调(PEFT)设置下评估 QA-SNNE,涵盖模板外问题。QA-SNNE 在 EndoVis18-VQA 上对三个零样本模型中的两个提升了模板内 AUROC(例如 Llama3.2 提升 +15%,Qwen2.5 提升 +21%),并在模板外改写下实现高达 +8% 的 AUROC 提升,但在外部验证上结果参差不齐。总体而言,QA-SNNE 通过将语义不确定性与问题相关性相关联,为手术 VQA 提供了一种实用的、与模型无关的安全保障。

关键词

引用

@article{arxiv.2511.01458,
  title  = {When to Trust the Answer: Question-Aligned Semantic Nearest Neighbor Entropy for Safer Surgical VQA},
  author = {Luca Carlini and Dennis Pierantozzi and Mauro Orazio Drago and Chiara Lena and Cesare Hassan and Elena De Momi and Danail Stoyanov and Sophia Bano and Mobarak I. Hoque},
  journal= {arXiv preprint arXiv:2511.01458},
  year   = {2026}
}