中文

openXDATA:一种用于多目标数据生成与缺失标签补全的工具

机器学习 2020-07-29 v1 声音 音频与语音处理

摘要

机器学习中的一个常见问题是处理具有不相交标签空间和缺失标签的数据集。在这项工作中,我们介绍了 openXDATA 工具,该工具可补全部分标注或未标注数据集中的缺失标签,从而生成在数据集联合标签空间下带有标签的多目标数据。为此,我们设计并实现了跨数据标签补全(CDLC)算法,该算法使用多任务共享隐藏层 DNN 迭代补全来自不同数据集的实例的稀疏标签矩阵。我们将这一新工具应用于跨四个情感数据集估计标签:一个标注为离散情感类别(如高兴、悲伤、愤怒),一个标注为沿唤醒度和效价维度的连续值,一个同时具有这两类标签,以及一个未标注。通过真实标签丢弃测试,我们展示了为所有数据集估计类别和连续标签的能力,其估计速率接近真实值。openXDATA 根据 GNU 通用公共许可证可从 https://github.com/fweninger/openXDATA 获取。

关键词

引用

@article{arxiv.2007.13889,
  title  = {openXDATA: A Tool for Multi-Target Data Generation and Missing Label Completion},
  author = {Felix Weninger and Yue Zhang and Rosalind W. Picard},
  journal= {arXiv preprint arXiv:2007.13889},
  year   = {2020}
}