中文

基于主观逻辑评估 AI 训练数据集可信度——以偏见为用例

机器学习 2026-05-12 v2 人工智能

摘要

随着 AI 系统越来越依赖训练数据,评估数据集可信度已成为关键问题,尤其是涉及公平性或偏见等仅在数据集层面显现的属性。先前的工作已使用主观逻辑评估单个数据点的可信度,但未针对仅在数据集整体层面显现的可信度属性进行评估。本文引入首个用于评估 AI 训练数据集可信度的正式框架,实现对全局属性(如偏见)不确定性感知的评估。该框架基于主观逻辑,支持信任命题,并在证据不完整、分布式或相互冲突的情境下量化不确定性。我们在偏见这一可信度属性上实现该框架,并基于交通标志识别数据集进行实验评估。结果表明,该方法能够捕捉类别不平衡现象,在集中式和联邦式情境中保持可解释性和鲁棒性。

关键词

引用

@article{arxiv.2508.13813,
  title  = {Assessing Trustworthiness of AI Training Dataset using Subjective Logic -- A Use Case on Bias},
  author = {Koffi Ismael Ouattara and Ioannis Krontiris and Theo Dimitrakos and Frank Kargl},
  journal= {arXiv preprint arXiv:2508.13813},
  year   = {2026}
}

备注

Accepted at ECML PKDD Bias Workshop '25