Text2Topic:具备零样本能力的用户生成内容高效主题检测多标签文本分类系统
机器学习
2023-10-24 v1
摘要
多标签文本分类是工业界的一项关键任务。它有助于从大量文本数据中提取结构化信息。我们提出 Text to Topic(Text2Topic),其通过采用 Bi-Encoder Transformer 架构,利用文本与主题上嵌入的拼接、相减和相乘,实现了高多标签分类性能。Text2Topic 还支持零样本预测,生成领域特定的文本嵌入,并实现具有高吞吐量的生产规模批量推理。与包括大语言模型(LLMs)在内的最先进基线相比,最终模型取得了准确且全面的结果。在本研究中,共定义了 239 个主题,并从 Booking.com 上 3 个主要数据源的约 120K 文本中收集了约 160 万文本-主题对标注(其中 200K 为正例)。数据通过优化的智能采样与部分标注收集。最终的 Text2Topic 模型部署于真实世界的流处理平台,以 92.9% 的微平均 mAP 以及 75.8% 的宏平均 mAP 分数优于其他模型。我们总结了通过消融研究广泛测试的建模选择,并分享了详细的生产环境决策步骤。
引用
@article{arxiv.2310.14817,
title = {Text2Topic: Multi-Label Text Classification System for Efficient Topic Detection in User Generated Content with Zero-Shot Capabilities},
author = {Fengjun Wang and Moran Beladev and Ofri Kleinfeld and Elina Frayerman and Tal Shachar and Eran Fainman and Karen Lastmann Assaraf and Sarai Mizrachi and Benjamin Wang},
journal= {arXiv preprint arXiv:2310.14817},
year = {2023}
}