中文

面向文本网页内容分类的混合 LSTM-CNN-Attention 模型研究

计算与语言 2025-12-29 v2 机器学习

摘要

本研究提出了一种集成LSTM、CNN和Attention机制的混合深度学习架构,以增强基于文本的网页内容分类。采用预训练的GloVe嵌入将单词表示为保持语义相似性的稠密向量。CNN层提取局部n-gram模式和词汇特征,而LSTM层则建模长程依赖关系和序列结构。集成的Attention机制使模型能够有选择地聚焦于输入序列中最具信息性的部分。采用5折交叉验证方案评估所提出方案的鲁棒性和可泛化性。实验结果表明,混合LSTM-CNN-Attention模型取得了卓越的性能,准确率为0.98,精确率为0.94,召回率为0.92,F1分数为0.93。这些结果超越了仅基于CNN、LSTM或基于Transformer的分类器如BERT的基线模型。该网络组件的组合使模型能够有效捕获细粒度文本结构和更广泛的语义上下文。此外,GloVe嵌入的使用为文本数据提供了高效且有效的表示,使模型适用于集成到需要实时或准实时要求的系统中。该混合架构在文本基于网页内容分类中表现出极高的有效性,特别是在需要同时提取语法特征和语义解释的任务中。通过组合所述机制,该模型解决了单个架构的局限性,实现了 improved 的泛化。这些发现支持了混合深度学习方法在NLP应用中的更广泛使用,尤其是在处理复杂且非结构化文本数据并以高可靠性进行分类的场景中。

关键词

引用

@article{arxiv.2512.18475,
  title  = {Research on a hybrid LSTM-CNN-Attention model for text-based web content classification},
  author = {Mykola Kuz and Ihor Lazarovych and Mykola Kozlenko and Mykola Pikuliak and Andrii Kvasniuk},
  journal= {arXiv preprint arXiv:2512.18475},
  year   = {2025}
}

备注

10 pages, 5 figures, 2 tables. Published by Radio Electronics Computer Science Control 2025