GazeVaLM:用于评估 AI 生成 X 射线临床真实性的多观察者眼动基准
计算机视觉与模式识别
2026-04-14 v1
摘要
我们介绍 GazeVaLM,这是一个公开的眼动数据集,用于研究胸腔 X 光片真实性评估期间的临床感知。该数据集包含来自 16 名专家放射科医师的 960 条眼动记录,他们在两种条件下解读 30 张真实和 30 张由基于扩散的生成式 AI 生成的胸腔 X 光片:诊断评估和真实-假分类(视觉图灵测试)。对于每对图像-观察者,我们提供原始眼动样本、注视图、扫描路径、注意力密度图、结构化诊断标签以及真实性判断。我们将该协议扩展到 6 个最先进的多模态大语言模型,公布其预测诊断、真实性标签及置信度得分,以匹配相同条件——实现在决策和不确定性水平上的直接人类-AI 比较。我们进一步提供了眼动一致性、观察者间一致性以及放射科医师与大语言模型在诊断准确率和真实性检测方面的基准测试分析。GazeVaLM 支持研究于眼动建模、临床决策、人类-AI 比较、生成图像真实性评估以及不确定性量化。通过联合发布视觉注意力数据、临床标签和模型预测,我们旨在促进关于专家和 AI 系统如何感知、解释和评估医学图像的可重复研究。该数据集可在 https://huggingface.co/datasets/davidcwong/GazeVaLM 获取。
引用
@article{arxiv.2604.11653,
title = {GazeVaLM: A Multi-Observer Eye-Tracking Benchmark for Evaluating Clinical Realism in AI-Generated X-Rays},
author = {David Wong and Zeynep Isik and Bin Wang and Marouane Tliba and Gorkem Durak and Elif Keles and Halil Ertugrul Aktas and Aladine Chetouani and Cagdas Topel and Nicolo Gennaro and Camila Lopes Vendrami and Tugce Agirlar Trabzonlu and Amir Ali Rahsepar and Laetitia Perronne and Matthew Antalek and Onural Ozturk and Gokcan Okur and Andrew C. Gordon and Ayis Pyrros and Frank H. Miller and Amir Borhani and Hatice Savas and Eric Hart and Elizabeth Krupinski and Ulas Bagci},
journal= {arXiv preprint arXiv:2604.11653},
year = {2026}
}
备注
This work appears in ACM ETRA 2026