中文

连续依赖数据的自监督对比学习理论框架

机器学习 2025-10-01 v4 人工智能

摘要

自监督学习(SSL)已成为学习表征的有力方法,尤其是在计算机视觉领域。然而,其在依赖数据(如时间域和时空域)上的应用仍未被充分探索。此外,传统的对比SSL方法通常假设样本之间存在语义独立性,而这一假设对于表现出复杂相关性的依赖数据并不成立。我们提出了一种专门针对连续依赖数据的对比SSL新理论框架,允许最近邻样本在语义上彼此接近。具体而言,我们提出了两种可能的对象间真实相似度度量——硬邻近度和软邻近度。在此基础上,我们推导了能够容纳样本间两种邻近类型的估计相似度矩阵的解析形式,从而引入了感知依赖关系的损失函数。我们在时间序列和时空下游问题上验证了所提出的方法 Dependent TS2Vec。鉴于数据中呈现的依赖模式,我们的方法超越了现有的依赖数据现代方法,凸显了我们基于理论的损失函数在SSL中捕获时空依赖关系的有效性。具体而言,我们在标准UEA和UCR基准测试上分别以4.17%和2.08%的准确率超越了TS2Vec。此外,在涉及复杂时空模式的干旱分类任务上,我们的方法实现了高出7%的ROC-AUC分数。

关键词

引用

@article{arxiv.2506.09785,
  title  = {A theoretical framework for self-supervised contrastive learning for continuous dependent data},
  author = {Alexander Marusov and Aleksandr Yugay and Alexey Zaytsev},
  journal= {arXiv preprint arXiv:2506.09785},
  year   = {2025}
}