面向数字台风数据集的机器学习:多个海洋盆地的扩展及表示与任务的最新进展
计算机视觉与模式识别
2024-11-26 v1 机器学习
摘要
本文提出了数字台风数据集 V2,这是最长的台风卫星图像数据集之一,旨在为基于机器学习的长期时空数据提供基准测试。数据集 V2 的新添加内容为来自南半球的热带风暴数据,除数据集 V1 中北半球的数据之外。拥有两个半球的数据使我们能够提出关于区域差异的新研究问题。我们还讨论了数据集在表示和任务方面的新发展。我们首先引入一种自监督学习框架,用于表示学习。结合 LSTM 模型,我们讨论了在强度预测和热带-温带转变预测任务上的性能。我们随后提出了新的任务,例如台风中心估计任务。我们表明,基于目标检测的模型在强烈台风上表现更好。最后,我们研究了机器学习模型如何在海洋盆地和半球之间泛化,通过在北半球数据上训练模型并在南半球数据上进行测试。该数据集可在 \url{http://agora.ex.nii.ac.jp/digital-typhoon/dataset/} 和 \url{https://github.com/kitamoto-lab/digital-typhoon/} 上公开获取。
引用
@article{arxiv.2411.16421,
title = {Machine Learning for the Digital Typhoon Dataset: Extensions to Multiple Basins and New Developments in Representations and Tasks},
author = {Asanobu Kitamoto and Erwan Dzik and Gaspar Faure},
journal= {arXiv preprint arXiv:2411.16421},
year = {2024}
}