排序优于分类:自然语言处理中排序的未开发潜力
计算与语言
2021-12-06 v4 机器学习
摘要
文本分类长期以来是自然语言处理(NLP)中的主要内容,其应用涵盖情感分析、推荐系统和垃圾邮件检测等多个领域。凭借如此强大的解决方案,人们常倾向于将其作为所有NLP问题的首选工具,毕竟手拿锤子,看什么都像钉子。然而,我们在此论证,许多当前使用分类方法处理的任务实际上是被生硬地套入分类框架,若将其作为排序问题处理,不仅能改进模型,还可获得更优性能。我们提出一种新颖的端到端排序方法,由一个负责为文本序列对生成表示的Transformer网络,以及随后将表示传入并输出排序分数的上下文聚合网络组成,该分数用于基于某种相关性概念确定序列的次序。我们在公开数据集上进行了大量实验,并探究了排序在通常用分类解决的问题中的应用。在一个严重倾斜的情感分析数据集上的实验中,将排序结果转换为分类标签比最先进的文本分类高出约22%的性能,证明了在特定场景下文本排序相对于文本分类的有效性。
引用
@article{arxiv.2009.05160,
title = {Rank over Class: The Untapped Potential of Ranking in Natural Language Processing},
author = {Amir Atapour-Abarghouei and Stephen Bonner and Andrew Stephen McGough},
journal= {arXiv preprint arXiv:2009.05160},
year = {2021}
}
备注
2021 IEEE International Conference on Big Data (IEEE BigData 2021)