去偏成就最优:重访基于简单种子的弱监督文本分类
计算与语言
2023-10-24 v2 人工智能
机器学习
摘要
弱监督文本分类的最新进展大多集中于设计复杂方法,将高层人类启发式规则转化为高质量的伪标签。本文中,我们重访基于种子匹配的方法——其可谓生成伪标签最简单的方式,并表明其实力被严重低估。我们展示了种子匹配有限的性能主要源于简单种子匹配规则所注入的标签偏置,这阻碍了分类器学习可靠的置信度以筛选高质量伪标签。有趣的是,简单地删除匹配输入文本中出现的种子词即可缓解标签偏置并有助于学习更好的置信度。随后,种子匹配所取得的性能可显著提升,使其与最先进水平相当甚至更优。此外,为处理种子词未知的情况,我们提出以高删除比例随机删除输入文本中的词 token。值得注意的是,配备该随机删除方法的种子匹配往往能取得比种子删除更好的性能。
引用
@article{arxiv.2305.14794,
title = {Debiasing Made State-of-the-art: Revisiting the Simple Seed-based Weak Supervision for Text Classification},
author = {Chengyu Dong and Zihan Wang and Jingbo Shang},
journal= {arXiv preprint arXiv:2305.14794},
year = {2023}
}
备注
EMNLP 2023