中文

解释 CLIP 在盲人或低视力用户数据上的性能差异

计算机视觉与模式识别 2024-03-26 v3

摘要

大型多模态模型(LMMs)有潜力为盲人或低视力(BLV)人群开启自动化视觉辅助的新时代。然而,这些模型尚未在 BLV 用户捕获的数据上进行系统评估。为此,我们通过对 CLIP(一种可能被广泛用于支撑诸多辅助技术的 LMM)进行实证评估来解决这一问题。在零样本分类任务中测试了 25 种 CLIP 变体,我们发现其对于 BLV 用户所拍摄图像的平均准确率比网络爬取图像低 15 个百分点。这一差异源于 CLIP 对以下三方面的敏感性:1)图像内容(例如,对其他物体的识别不如对残疾相关物体的识别);2)图像质量(例如,对光照变化不够鲁棒);3)文本内容(例如,对由触觉形容词描述的对象不如视觉形容词描述的对象识别得好)。我们通过对三个常见预训练数据集 LAION-400M、LAION-2B 和 DataComp-1B 的文本分析进一步深入,表明其中极少提及残疾相关内容。随后,我们给出三个示例,说明该性能差异如何延伸至由 CLIP 支撑的三个下游模型:OWL-ViT、CLIPSeg 和 DALL-E2。我们发现,在某些场景下,少至 5 张图像的少样本学习可以缓解 CLIP 对 BLV 用户服务质量上的差异,我们结合其他一组可能的缓解措施对此进行了讨论。

关键词

引用

@article{arxiv.2311.17315,
  title  = {Explaining CLIP's performance disparities on data from blind/low vision users},
  author = {Daniela Massiceti and Camilla Longden and Agnieszka Słowik and Samuel Wills and Martin Grayson and Cecily Morrison},
  journal= {arXiv preprint arXiv:2311.17315},
  year   = {2024}
}

备注

Accepted at 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)