质量无关的图像描述生成以安全辅助视障人士
计算机视觉与模式识别
2023-05-02 v2
摘要
自动化图像描述生成有潜力成为视障人士的有用工具。该用户群体拍摄的图像通常含有噪声,这会导致模型预测错误甚至不安全。在本文中,我们提出了一种质量无关的框架,以提升面向视障人士的图像描述生成模型的性能和鲁棒性。我们从数据、模型和评估三个角度解决该问题。首先,我们展示了用于生成合成噪声的数据增强技术如何解决该领域的数据稀疏性。其次,我们通过将最先进模型扩展为双网络架构,利用增强数据并借助不同的一致性损失,增强了模型的鲁棒性。我们的结果表明性能有所提升,例如与最先进的图像描述生成网络相比,CIDEr绝对提升2.15,并且在更嘈杂的设置下对噪声的鲁棒性提升高达CIDEr 3分。最后,我们使用置信度校准在不同难度/噪声水平的图像上评估预测可靠性,表明我们的模型在安全关键情况下表现更可靠。改进后的模型是一个辅助生活应用的一部分,我们与英国皇家盲人协会合作开发了该应用。
引用
@article{arxiv.2304.14623,
title = {Quality-agnostic Image Captioning to Safely Assist People with Vision Impairment},
author = {Lu Yu and Malvina Nikandrou and Jiali Jin and Verena Rieser},
journal= {arXiv preprint arXiv:2304.14623},
year = {2023}
}
备注
To appear in IJCAI 2023