不平衡数据集上的训练
分布式、并行与集群计算
2020-08-24 v1 人工智能
摘要
英文。以下文档旨在比较一些用于平衡数据集并获得训练模型的有用方法。用于训练的数据集由短句和中等长度句子组成,例如简单短语或来自网络渠道对话的摘录。模型的训练将借助Apache Spark框架提供的结构进行,这些模型随后可能有助于实现一种能够利用分布式环境对句子进行分类的解决方案,如Massimiliano Morrelli等人的“文本分类的新前沿:大数据与分布式计算”所述。意大利文。以下文档旨在比较一些用于平衡数据集并获得训练模型的有用方法。用于训练的数据集由短句和中等长度句子组成,例如简单短语或来自网络渠道对话的摘录。模型的训练将借助Apache Spark框架提供的结构进行,这些模型随后可能有助于实现一种能够利用分布式环境对句子进行分类的解决方案,如Massimiliano Morrelli等人的“文本分类的新前沿:大数据与分布式计算”所述。
引用
@article{arxiv.2008.09209,
title = {Addestramento con Dataset Sbilanciati},
author = {Massimiliano Morrelli},
journal= {arXiv preprint arXiv:2008.09209},
year = {2020}
}
备注
in Italian