利用有偏表示学习去偏表示
计算机视觉与模式识别
2020-07-02 v3 机器学习
机器学习
摘要
许多机器学习算法通过将单一来源的数据划分为训练集和测试集来进行训练和评估。虽然这种对分布内学习场景的关注带来了有趣的进展,但它无法判断模型是否将数据集偏差作为成功预测的捷径(例如,利用雪地线索识别雪地摩托),从而导致有偏模型在偏差转移到不同类别时无法泛化。跨偏差泛化问题已通过增强或重采样对训练数据去偏来解决,但由于数据收集成本(例如,收集沙漠中雪地摩托的图像)以及最初量化或表达偏差的困难,这些方法往往难以施行。本工作中,我们提出一种新框架,通过鼓励去偏表示与一组人为设计为有偏的表示相异来训练去偏表示。该策略在许多场景下可行,因为定义一组有偏表示远比定义和量化偏差容易。我们在多种合成与真实世界偏差上展示了方法的有效性;实验表明该方法阻止模型走偏差捷径,从而改善泛化。源代码见 https://github.com/clovaai/rebias。
引用
@article{arxiv.1910.02806,
title = {Learning De-biased Representations with Biased Representations},
author = {Hyojin Bahng and Sanghyuk Chun and Sangdoo Yun and Jaegul Choo and Seong Joon Oh},
journal= {arXiv preprint arXiv:1910.02806},
year = {2020}
}
备注
Accepted to ICML 2020. Code available at https://github.com/clovaai/rebias