作为辅助技术的图像描述:来自VizWiz 2020挑战赛的经验教训
计算机视觉与模式识别
2024-10-30 v2 机器学习
摘要
图像描述近期取得了令人瞩目的进展,这在很大程度上归功于在MS-COCO等精选数据集上训练的神经网路算法的引入。该领域的研究常以将描述系统部署于实际应用为愿景。然而,许多竞赛数据集数据与场景的稀缺,使得基于这些数据集训练的系统作为辅助技术在真实场景(例如帮助视障人士导航并完成日常任务)中的效用受限。这一鸿沟催生了新型VizWiz数据集,其由视障人士拍摄的图像以及包含有用、面向任务信息的描述组成。为助力机器学习计算机视觉领域实现其产生积极社会影响技术的承诺,VizWiz数据集的构建者举办了多项竞赛,包括一项图像描述竞赛。本文详述了我们赢得2020年描述竞赛提交方案的理论与工程实现。我们的工作向改进的辅助图像描述系统迈进了一步。
引用
@article{arxiv.2012.11696,
title = {Image Captioning as an Assistive Technology: Lessons Learned from VizWiz 2020 Challenge},
author = {Pierre Dognin and Igor Melnyk and Youssef Mroueh and Inkit Padhi and Mattia Rigotti and Jarret Ross and Yair Schiff and Richard A. Young and Brian Belgodere},
journal= {arXiv preprint arXiv:2012.11696},
year = {2024}
}
备注
In submission to JAIR