面向 Query 2.0 的投诉驱动训练数据调试
数据库
2020-04-14 v1 人工智能
机器学习
摘要
随着所有行业对机器学习(ML)需求迅速增长,商业数据库提供商对支持“Query 2.0”(将模型推断集成至 SQL 查询中)表现出浓厚兴趣。调试 Query 2.0 非常具有挑战性,因为意外的查询结果可能由训练数据中的错误(例如错误标签、损坏特征)引起。为此,我们提出 Rain,一个投诉驱动的训练数据调试系统。Rain 允许用户对查询的中间或最终输出指定投诉,并旨在返回最小的训练样本集,使得若将其移除,投诉便可被解决。据我们所知,我们是首个研究该问题的工作。一种朴素解法需要以指数级次数重新训练 ML 模型。我们提出两种基于影响函数的启发式新方法,二者均只需线性次重新训练步骤。我们对这两种方法给出了深入的分析与实证分析,并利用四个真实世界数据集开展了广泛实验以评估其有效性。结果表明,Rain 在所有基线中取得了最高的 recall@k(前 k 召回率),同时仍能交互式地返回结果。
引用
@article{arxiv.2004.05722,
title = {Complaint-driven Training Data Debugging for Query 2.0},
author = {Weiyuan Wu and Lampros Flokas and Eugene Wu and Jiannan Wang},
journal= {arXiv preprint arXiv:2004.05722},
year = {2020}
}
备注
Proceedings of the 2020 ACM SIGMOD International Conference on Management of Data