涉及领域专家的生成数据表示去偏方法
人机交互
2024-07-16 v1
摘要
由于数据集偏斜导致的人工智能( AI)或机器学习( ML)系统偏差,常常限制其在实际中的应用。表示偏差是数据集中常见的偏差形式,产生于训练数据不充分代表数据空间的特定片段,导致预测模型泛化能力差。尽管AI实践者采用各种方法来缓解表示偏差,但其效果往往受限于缺乏充分的领域知识。为此,本文引入涉及领域专家的人类在环交互方法,用于生成数据的表示去偏。我们的工作主张通过领域专家参与的受控数据生成过程来有效缓解表示偏差的影响。我们认为,领域专家可以利用其专业知识来评估表示偏差如何影响预测模型。此外,我们的交互方法可以促进领域专家引导数据增强算法生成去偏增强数据,并验证或细化生成样本以减少表示偏差。我们还讨论了如何利用这些方法来设计和开发以用户为中心的AI系统,通过领域专家与AI之间的有效协作来减轻表示偏差的影响。
引用
@article{arxiv.2407.09485,
title = {Representation Debiasing of Generated Data Involving Domain Experts},
author = {Aditya Bhattacharya and Simone Stumpf and Katrien Verbert},
journal= {arXiv preprint arXiv:2407.09485},
year = {2024}
}
备注
Pre-print of a paper accepted for ACM UMAP 2024