声学场景分类中的公平性与欠规范性:析因评估的必要性
机器学习
2021-10-05 v1 计算机与社会
摘要
机器学习(ML)应用中的欠规范性与公平性近来已成为ML界的两个突出问题。声学场景分类(ASC)应用迄今未受此讨论影响,但正日益用于公平性与可靠性至关重要的真实系统中。本文主张需要通过析因评估对ASC模型采取更整体的评估流程。这意味着要考虑城市、地点与录音设备等多因素下的性能差异。尽管这些因素对ASC模型性能的作用已被充分理解,多数工作仍报告将特定数据集所有不同层合并计算的单一评估指标。我们认为,基于底层数据特定子群体计算的指标包含关于所提系统预期真实行为的宝贵信息,其报告可提升此类系统的透明度与可信度。我们在两个广泛使用的ASC数据集上,以若干标准ML架构训练,展示了所提评估流程在揭示欠规范性与公平性问题的有效性。我们的评估表明,所有被考察架构在考量各因素时均表现出较大偏差,尤其相对于录音地点。此外,不同架构即便以相同实验配置训练也表现出不同偏差。
引用
@article{arxiv.2110.01506,
title = {Fairness and underspecification in acoustic scene classification: The case for disaggregated evaluations},
author = {Andreas Triantafyllopoulos and Manuel Milling and Konstantinos Drossos and Björn W. Schuller},
journal= {arXiv preprint arXiv:2110.01506},
year = {2021}
}