数据集是否符合预期?解释图像数据中的样本表征
计算机视觉与模式识别
2020-12-17 v1 机器学习
摘要
由于神经网络模型的行为会受到训练数据多样性不足的负面影响,我们提出一种识别并解释此类缺陷的方法。当数据集带有标注时,我们注意到仅标注本身就能提供人类可理解的样本多样性摘要。这允许将任何多样性不足解释为:当比较数据集中标注的\textit{实际}分布与手动指定的\textit{期望}标注分布(用于捕捉本质的标签多样性)时所发现的失配。虽然在许多实际情况下,标注(样本 标注)是昂贵的,但其逆过程,即仿真(标注 样本)可能更廉价。通过使用参数化仿真将期望的标注分布映射为测试样本,我们提出了一种利用仿真数据与采集数据之间多样性失配来解释样本表征的方法。随后我们将该方法应用于一个几何形状数据集,从尺寸、位置和像素亮度等可理解方面定性和定量地解释样本表征。
引用
@article{arxiv.2012.08642,
title = {Does the dataset meet your expectations? Explaining sample representation in image data},
author = {Dhasarathy Parthasarathy and Anton Johansson},
journal= {arXiv preprint arXiv:2012.08642},
year = {2020}
}
备注
Preprint of paper accepted at BNAIC/BeneLearn 2020