数据估值可学习且可解释吗?
机器学习
2024-06-06 v1 人工智能
摘要
衡量单个样本的价值对于许多数据驱动任务至关重要,例如深度学习模型的训练。近期文献见证了在开发数据估值方法方面所做的大量努力。主要数据估值方法基于博弈论的Shapley值,沿着这一路径提出了各种方法。尽管Shapley值基于估值的方法具有坚实的理论基础,但它完全是实验性的方法,迄今尚未构建任何估值模型。此外,当前的数据估值方法忽略了输出值的可解释性,尽管可解释的数据估值方法对于诸如数据定价等应用具有重要帮助。本研究旨在回答一个重要问题:数据估值可学习且可解释吗?一种学习的估值模型具有多个令人期待的优势,例如固定参数数量和知识可复用性。一种不可解释的数据估值模型可以解释为何该样本具有价值或不具有价值。为此,提出了两种新的数据价值建模框架,其中利用多层感知机(MLP)和一种新的回归树作为特定的基模型进行训练和可解释性。对基准数据集进行了大量实验。实验结果为该问题提供了肯定答案。我们的研究开辟了数据价值评估的新技术路径。可以在许多不同的数据驱动任务中构建大型数据估值模型,这有助于推动数据估值的广泛应用。
引用
@article{arxiv.2406.02612,
title = {Is Data Valuation Learnable and Interpretable?},
author = {Ou Wu and Weiyao Zhu and Mengyang Li},
journal= {arXiv preprint arXiv:2406.02612},
year = {2024}
}