通过文本分类进行多级产品类别预测
计算与语言
2024-03-05 v1
摘要
本文研究了应用先进的机器学习模型,特别是 LSTM 和 BERT,通过文本分类来预测零售领域的多个类别。该研究展示了如何应用数据增强技术和焦点损失函数,利用一个稳健的巴西零售数据集,显著提高将产品分类到多个类别的准确性。融入了巴西词嵌入的 LSTM 模型,以及以理解复杂上下文有效性著称的 BERT,都针对这一特定任务进行了适配和优化。结果表明,BERT 模型的 F1 Macro Score 在细分市场高达 ,在类别和子类别中达到 ,在产品名称中达到 ,在更详细的类别中优于 LSTM。然而,LSTM 也取得了高性能,特别是在应用了数据增强和焦点损失技术之后。这些结果突显了 NLP 技术在零售业的有效性,并强调了仔细选择建模和预处理策略的重要性。这项工作对零售领域的 NLP 研究做出了重大贡献,为未来的研究和实际应用提供了有价值的见解。
引用
@article{arxiv.2403.01638,
title = {Multi-level Product Category Prediction through Text Classification},
author = {Wesley Ferreira Maia and Angelo Carmignani and Gabriel Bortoli and Lucas Maretti and David Luz and Daniel Camilo Fuentes Guzman and Marcos Jardel Henriques and Francisco Louzada Neto},
journal= {arXiv preprint arXiv:2403.01638},
year = {2024}
}