中文

大数据异构性挑战:大规模结构化与非结构化域分类的比较研究

机器学习 2025-12-02 v1 计算与语言 分布式、并行与集群计算

摘要

本研究通过比较结构化(Epsilon)和非结构化(Rest-Mex、IMDB)领域中的分类策略来分析大数据中异构性(“Variety”)的影响。实施了双重方法:针对数值数据采用演化方法和贝叶斯超参数优化(遗传算法、Optuna)进行实验;针对大规模文本语料库采用 Apache Spark 分布式处理。结果揭示了一个“复杂悖论”:在高维空间中,优化后的线性模型(SVM、Logistic Regression)超过深度网络和梯度提升树。相反,在文本领域,分布式微调的约束导致复杂模型过拟合,而鲁棒的特征工程——具体而言是基于 Transformer 的嵌入(ROBERTa)和贝叶斯目标编码——使更简单的模型能够有效泛化。本工作提供了一个基于数据性质和基础设施约束进行算法选择的统一框架。

关键词

引用

@article{arxiv.2512.00298,
  title  = {Challenges of Heterogeneity in Big Data: A Comparative Study of Classification in Large-Scale Structured and Unstructured Domains},
  author = {González Trigueros Jesús Eduardo and Alonso Sánchez Alejandro and Muñoz Rivera Emilio and Peñarán Prieto Mariana Jaqueline and Mendoza González Camila Natalia},
  journal= {arXiv preprint arXiv:2512.00298},
  year   = {2025}
}

备注

13 pages, 1 figure, 3 tables. Comparative study involving Apache Spark and Hyperparameter Optimization. Keywords: Big Data, NLP, Tabular Data