通过学习与蒸馏公平表示生成语法无关的公平合成数据
机器学习
2024-08-21 v1 人工智能
摘要
数据公平性是一个至关重要的主题,由于 AI 驱动应用的广泛使用。最近的大多数真实世界数据充满了人为或机器偏见,当这些数据被用于训练 AI 模型时,模型有可能反映训练数据中的偏见。现有的基于 GAN 和扩散模型的偏见缓解生成方法需要内处理公平性目标,并且在选择计算密集型架构时未能考虑计算开销,这可能导致高计算需求、不稳定性和较差的优化性能。为缓解这一问题,本工作提出了一种基于知识蒸馏的公平数据生成技术,其中我们使用小架构在潜在空间中蒸馏公平表示。公平潜在空间蒸馏的思想使公平生成模型(FGM)的训练更加灵活和稳定。我们首先学习一种语法无关(适用于任何数据类型)的公平数据表示,随后在潜在空间中蒸馏到更小模型。蒸馏后,我们使用蒸馏后的公平潜在空间生成高保真度的公平合成数据。在蒸馏过程中,我们采用质量损失(用于公平蒸馏)和效用损失(用于数据效用)以确保公平性和数据效用特性保留在蒸馏后的潜在空间中。我们的方法在公平性、合成样本质量和数据效用方面分别比最先进的公平生成模型提升了 5%、5% 和 10%。
引用
@article{arxiv.2408.10755,
title = {Generating Synthetic Fair Syntax-agnostic Data by Learning and Distilling Fair Representation},
author = {Md Fahim Sikder and Resmi Ramachandranpillai and Daniel de Leng and Fredrik Heintz},
journal= {arXiv preprint arXiv:2408.10755},
year = {2024}
}