Chameleon:面向公平感知的多模态数据增强以提升少数群体覆盖度的基础模型
机器学习
2024-12-03 v1 计算机与社会
数据库
摘要
训练数据中少数群体代表性不足的潜在危害,尤其是在多模态环境中,是一个公认的担忧。尽管在检测这种代表性不足方面已有大量努力,但解决方案仍然是一个挑战。随着生成式人工智能的最新进展,大语言模型和基础模型已成为跨多个领域的多功能工具。在本文中,我们提出了 Chameleon,这是一个高效利用这些工具的系统,通过最少地添加合成生成的元组来增强数据集,以提升对代表性不足群体的覆盖度。我们的系统遵循拒绝采样方法,以确保生成的元组具有高质量并遵循底层分布。为了最小化生成元组的拒绝概率,我们提出了多种为指导基础模型提供引导的策略。我们的实验结果,除了证实所提算法的效率外,还说明了我们方法的有效性,因为在使用 Chameleon 进行数据修复后,下游任务中模型的不公平性显著下降。
引用
@article{arxiv.2402.01071,
title = {Chameleon: Foundation Models for Fairness-aware Multi-modal Data Augmentation to Enhance Coverage of Minorities},
author = {Mahdi Erfanian and H. V. Jagadish and Abolfazl Asudeh},
journal= {arXiv preprint arXiv:2402.01071},
year = {2024}
}