中文

TDBench:面向顶视图图像理解与视觉语言模型可靠性分析的基准

机器学习 2025-10-02 v2 人工智能 计算与语言

摘要

顶视图图像在自主导航和空中监视等安全关键场景中发挥着重要作用,因为它们提供了正面视图无法捕捉的整体空间信息。尽管如此,视觉语言模型(VLM)大多是在正面视图基准上进行训练和评估的,导致其在顶视图设置下的性能鲜为人知。现有的评估还忽略了顶视图图像的一个独特属性:其物理意义在旋转下保持不变。此外,传统的准确率指标可能具有误导性,因为它们常常因幻觉或“幸运猜测”而膨胀,从而掩盖了模型真实的可靠性及其对视觉证据的依赖。为解决这些问题,我们引入了TDBench,一个面向顶视图图像理解的基准,包含每个旋转角度下的2000个精心设计的问题。我们进一步提出了RotationalEval(RE),用于衡量模型在相同场景的四个旋转视图上是否提供一致的答案,并开发了一个可靠性框架,将真实知识与偶然猜测区分开来。最后,我们针对尚未充分探索的现实世界挑战开展了四个案例研究。通过将严格评估与可靠性指标相结合,TDBench不仅对VLM在顶视图感知中的表现进行了基准测试,还为可信赖性提供了新视角,指导开发更鲁棒、更可靠的AI系统。项目主页:https://github.com/Columbia-ICSL/TDBench

关键词

引用

@article{arxiv.2504.03748,
  title  = {TDBench: A Benchmark for Top-Down Image Understanding with Reliability Analysis of Vision-Language Models},
  author = {Kaiyuan Hou and Minghui Zhao and Lilin Xu and Yuang Fan and Xiaofan Jiang},
  journal= {arXiv preprint arXiv:2504.03748},
  year   = {2025}
}