通过乌托邦标签分布近似学习主观时间序列数据
机器学习
2023-07-18 v1
摘要
主观时间序列回归(STR)任务近年来受到越来越多的关注。然而,大多数现有方法忽视了 STR 数据中的标签分布偏差,从而导致有偏的模型。针对不平衡回归任务(如年龄估计和深度估计)的新兴研究假设数据集的先验标签分布是均匀的。但我们观察到,在 STR 任务中训练集与测试集的标签分布既可能非均匀,也可能互不相同。这一显著特征要求新的方法估计更合理的分布以训练公平的模型。本工作中,我们提出面向时间序列数据的乌托邦标签分布近似(ULDA),其使训练标签分布更接近真实世界但未知(乌托邦)的标签分布,从而增强模型的公平性。具体而言,ULDA 首先用高斯核对训练标签分布进行卷积。卷积后,各回归标签所需的样本数量可能发生变化。我们进一步设计了时间切片正态采样(TNS)以在所需样本量大于初始样本量时生成新样本,以及卷积加权损失(CWL)以在所需样本量小于初始样本量时降低样本权重。这两个模块不仅辅助模型在近似乌托邦标签分布上训练,还保持了时间上下文空间中的样本连续性。据我们所知,ULDA 是首个解决时间序列数据中标签分布偏差的方法。大量实验表明,ULDA 在两个 STR 任务和三个基准数据集上提升了 SOTA 性能。
引用
@article{arxiv.2307.07682,
title = {Learning Subjective Time-Series Data via Utopia Label Distribution Approximation},
author = {Wenxin Xu and Hexin Jiang and Xuefeng Liang and Ying Zhou and Yin Zhao and Jie Zhang},
journal= {arXiv preprint arXiv:2307.07682},
year = {2023}
}
备注
13 pages