位置:不要只宣称,要衡量数据集多样性
机器学习
2025-02-25 v3 人工智能
硬件体系结构
摘要
机器学习(ML)数据集往往被视为中性,但实际上内嵌了抽象且争议的社会建构。数据集策划者经常使用诸如多样性、偏见和质量等价值相关的术语来描述数据集。尽管这些术语广泛使用,但缺乏明确的定义和验证。我们的研究通过分析 135 个图像和文本数据集中的“多样性”,并借鉴社会科学的视角,运用测量理论的原则,提出概念化、操作化和评估数据集多样性的考量因素,并提供建议。我们的发现对机器学习研究具有更广泛的意义,主张在数据集构建中采取更为细致和精确的处理方式,以应对价值相关属性。
引用
@article{arxiv.2407.08192,
title = {Dynamic Co-Optimization Compiler: Leveraging Multi-Agent Reinforcement Learning for Enhanced DNN Accelerator Performance},
author = {Arya Fayyazi and Mehdi Kamal and Massoud Pedram},
journal= {arXiv preprint arXiv:2407.08192},
year = {2025}
}
备注
Proceeding of ASP-DAC25