中文

利用时域全局相似度方法改进聚变数据清洗中的训练集结构

机器学习 2017-10-25 v1 等离子体物理

摘要

传统数据清洗通过分类原始数据序列来识别脏数据,这是一个类不平衡问题,因为对于磁约束聚变(MCF)装置中的大多数诊断系统,错误数据比例远小于正确数据比例。当使用机器学习算法基于类不平衡训练集对诊断数据进行分类时,大多数分类器偏向多数类,并在少数类上表现出极低的分类率。本文将关于原始数据序列的直接分类问题转化为关于数据序列间物理相似度的分类问题,研究了时域全局相似度(TDGS)方法对训练集结构的类平衡效应。同时,以 EAST 偏振-干涉(POINT)系统中的应用为例,展示了改进的训练集结构对 TDGS 方法数据清洗性能的影响。

关键词

引用

@article{arxiv.1706.10018,
  title  = {Improvement of training set structure in fusion data cleaning using Time-Domain Global Similarity method},
  author = {Jian Liu and Ting Lan and Hong Qin},
  journal= {arXiv preprint arXiv:1706.10018},
  year   = {2017}
}