热舒适数据集的平衡:我们使用GAN,但真有必要吗?
机器学习
2020-11-25 v1 机器学习
摘要
由于传感器和主观反馈方法的普及,建筑环境中的热舒适评估已对分析人员和研究人员变得更加可及。这些数据可用于建模舒适行为,以支持面向能效与福祉的设计与运行。本质上,居住者主观反馈是不平衡的,因为室内环境是为舒适而设计的,表明非舒适状态的反馈较为少见。这种情况为机器学习工作流创造了一种场景:作为预处理步骤的类别平衡,可能有助于开发高性能的预测式热舒适分类模型。本文调研了文献中的各类热舒适数据集类别平衡技术,并提出了一种改进的条件生成对抗网络(GAN),即 ,以应对该不平衡场景。这些方法被应用于三个公开数据集,其参与者规模从30和67人到一个全球热舒适数据集集合不等,分别包含1,474、2,067和66,397个数据点。本工作发现,在由 生成的真实样本与合成样本组成的平衡数据集上训练的分类模型,比其他所测试的增强方法具有更高的性能(分类准确率提升4%至17%)。然而,当代表不舒适的类别被合并并缩减为三类时,预期不平衡性能更好,且 带来的额外性能提升缩小至1-2%。这些结果表明,使用诸如GAN等先进技术对热舒适建模进行类别平衡是有益的,但在某些场景下其价值会减弱。文中还提供了讨论,以帮助潜在用户判断在哪些场景下该过程有用以及哪种方法效果最佳。
引用
@article{arxiv.2009.13154,
title = {Balancing thermal comfort datasets: We GAN, but should we?},
author = {Matias Quintana and Stefano Schiavon and Kwok Wai Tham and Clayton Miller},
journal= {arXiv preprint arXiv:2009.13154},
year = {2020}
}
备注
10 pages, submitted and accepted to BuildSys'20 (http://buildsys.acm.org/2020/)