Google Bard 的视觉理解能力如何?一项关于开放挑战的实证研究
计算机视觉与模式识别
2023-08-31 v2 人工智能
机器学习
摘要
Google 的 Bard 已成为 OpenAI 的 ChatGPT 在对话式 AI 领域的强劲竞争者。值得注意的是,Bard 近期已更新为可在对话中处理视觉输入与文本提示。鉴于 Bard 处理文本输入的出色记录,我们探索其在由文本问题条件下的视觉数据(图像)理解与解释能力。该探索有望为 Bard 及其他即将问世的多模态生成模型揭示新见解与挑战,尤其在解决需要精确视觉与语言理解的复杂计算机视觉问题方面。具体而言,本研究聚焦 15 种多样任务场景,涵盖常规、伪装、医学、水下与遥感数据,以全面评估 Bard 的性能。我们的主要发现表明 Bard 在这些视觉场景中仍显吃力,突显了未来开发中需弥合的基于视觉理解的显著差距。我们期望本实证研究能有助于推进未来模型,提升其对细粒度视觉数据理解与解释的能力。我们的项目发布于 https://github.com/htqin/GoogleBard-VisUnderstand
引用
@article{arxiv.2307.15016,
title = {How Good is Google Bard's Visual Understanding? An Empirical Study on Open Challenges},
author = {Haotong Qin and Ge-Peng Ji and Salman Khan and Deng-Ping Fan and Fahad Shahbaz Khan and Luc Van Gool},
journal= {arXiv preprint arXiv:2307.15016},
year = {2023}
}