FIND:基于人在回路调试深度文本分类器
计算与语言
2020-10-13 v1 人机交互
机器学习
摘要
由于获得完美的训练数据集(即足够大、无偏且能良好代表未知情况的数据集)几乎不可能,许多现实世界文本分类器是在可用却不完美的数据集上训练的。这些分类器因此可能具有不良性质。例如,它们可能对某些子群体存在偏见,或因过拟合而在实际中无法有效工作。本文中,我们提出 FIND——一个通过禁用无关隐特征使人能够调试深度学习文本分类器的框架。实验表明,通过使用 FIND,人类可改进在不同类型不完美数据集(包括含偏见的数据集及训练-测试分布相异的数据集)下训练的 CNN 文本分类器。
引用
@article{arxiv.2010.04987,
title = {FIND: Human-in-the-Loop Debugging Deep Text Classifiers},
author = {Piyawat Lertvittayakumjorn and Lucia Specia and Francesca Toni},
journal= {arXiv preprint arXiv:2010.04987},
year = {2020}
}
备注
17 pages including appendices; To appear at EMNLP 2020