muBoost:一种解决印度多语言文本分类问题的有效方法
计算与语言
2022-06-22 v1 机器学习
摘要
文本分类是许多自然语言处理任务(如讽刺检测、情感分析及诸多此类应用)的重要组成部分。许多电子商务网站、社交媒体/娱乐平台使用此类模型来提升用户体验,从而在其平台上产生流量与收入。在本文中,我们展示了针对 Moj(一个由 ShareChat 提供支持的印度视频共享社交网络服务)上的多语言辱骂性评论识别问题的解决方案。该问题涉及检测 Moj 平台视频上以 13 种印度地区语言(如印地语、泰卢固语、卡纳达语等)撰写的辱骂性评论。我们的解决方案利用新颖的 muBoost(CatBoost 分类器模型与印度语言多语言表示(MURIL)模型的集成)在印度语言文本分类任务上取得 SOTA 性能。我们在测试数据上达到了 89.286 的平均 F1 分数,较基线 MURIL 模型 87.48 的 F1 分数有所提升。
引用
@article{arxiv.2206.10280,
title = {muBoost: An Effective Method for Solving Indic Multilingual Text Classification Problem},
author = {Manish Pathak and Aditya Jain},
journal= {arXiv preprint arXiv:2206.10280},
year = {2022}
}