中文

用于不平衡分析的平衡音视频数据集

机器学习 2023-06-09 v2 计算机视觉与模式识别 多媒体

摘要

不平衡问题在机器学习领域十分普遍,在多模态学习领域中也因样本各模态间的内在差异而存在。近期工作试图从算法角度解决模态不平衡问题,然而它们并未充分分析数据集中模态偏差的影响。具体而言,现有多模态数据集通常在特定任务下收集,其中某一模态在大多数情况下往往优于其他模态。本文中,为全面探究模态偏差的影响,我们首先通过估计样本级模态差异将现有数据集划分为不同子集。我们惊讶地发现:在具有模态偏差的特定子集上,采用现有不平衡算法的多模态模型表现始终不如单模态模型。为进一步探索模态偏差的影响并分析现有不平衡算法的有效性,我们构建了一个平衡音视频数据集,其模态差异在整个数据集中均匀分布。随后我们开展大量实验重新评估现有不平衡算法,并得出一些有趣发现:现有算法仅在模态间提供折中,且受样本较大模态差异的困扰。我们希望这些发现能推动未来关于模态不平衡问题的研究。

关键词

引用

@article{arxiv.2302.10912,
  title  = {Balanced Audiovisual Dataset for Imbalance Analysis},
  author = {Wenke Xia and Xu Zhao and Xincheng Pang and Changqing Zhang and Di Hu},
  journal= {arXiv preprint arXiv:2302.10912},
  year   = {2023}
}

备注

website:https://gewu-lab.github.io/Balanced-Audiovisual-Dataset/