中文

Domino:利用跨模态嵌入发现系统性错误

机器学习 2022-05-24 v3 人工智能

摘要

取得高整体准确率的机器学习模型常在重要数据子集(或切片)上犯系统性错误。在处理高维输入(如图像、音频)时,识别表现不佳的切片尤其具有挑战性,因为重要切片往往未被标注。为解决此问题,近期研究提出了自动切片发现方法(SDM),其利用学到的模型表征来挖掘输入数据中以寻找模型表现糟糕的切片。要对从业者有用,这些方法必须识别出既表现不佳又连贯(即由人类可理解的概念统一)的切片。然而,目前不存在用于严格依据这些标准评估 SDM 的定量评估框架。此外,先前的定性评估表明 SDM 常识别出不连贯的切片。在本工作中,我们通过首先设计一个原则性评估框架来应对这些挑战,该框架能够在三种输入域(自然图像、医学图像和时间序列数据)的 1,235 个切片发现设置下对 SDM 进行定量比较。随后,受近期强大跨模态表征学习进展的启发,我们提出 Domino,一种利用跨模态嵌入和一种新颖的误差感知混合模型来发现并描述连贯切片的 SDM。我们发现 Domino 准确识别了框架中 1,235 个切片里的 36%——比先前方法提升 12 个百分点。此外,Domino 是首个能提供所识别切片自然语言描述的 SDM,在 35% 的设置下正确生成了切片的精确名称。

关键词

引用

@article{arxiv.2203.14960,
  title  = {Domino: Discovering Systematic Errors with Cross-Modal Embeddings},
  author = {Sabri Eyuboglu and Maya Varma and Khaled Saab and Jean-Benoit Delbrouck and Christopher Lee-Messer and Jared Dunnmon and James Zou and Christopher Ré},
  journal= {arXiv preprint arXiv:2203.14960},
  year   = {2022}
}

备注

ICLR 2022 (Oral)