面向机器“理解”与面向无障碍辅助的视觉问答有何不同?
计算与语言
2022-10-28 v1 人工智能
计算机视觉与模式识别
摘要
在视觉问答(VQA)中,机器必须根据给定的相关图像回答问题。最近,无障碍领域的研究人员探索了VQA是否可以部署在真实世界环境中,让视障用户通过捕捉其视觉环境并提问来了解周围环境。然而,大多数现有的VQA基准数据集都侧重于机器“理解”,目前尚不清楚在这些数据集上取得的进展如何对应于这一真实世界用例的改进。我们旨在通过评估多种VQA模型,评估机器“理解”数据集(VQA-v2)与无障碍数据集(VizWiz)之间的差异,来回答这个问题。基于我们的发现,我们讨论了面向无障碍的VQA的机遇与挑战,并提出了未来工作的方向。
引用
@article{arxiv.2210.14966,
title = {What's Different between Visual Question Answering for Machine "Understanding" Versus for Accessibility?},
author = {Yang Trista Cao and Kyle Seelman and Kyungjun Lee and Hal Daumé},
journal= {arXiv preprint arXiv:2210.14966},
year = {2022}
}