重叠词移除即所需:重新审视希望语音检测中的数据不平衡
计算与语言
2023-01-20 v1
摘要
希望语音检测,即识别积极表达的任务,近来已取得显著进展。然而,当前许多工作聚焦于模型开发,未考虑数据固有不平衡的问题。我们的工作通过引入 focal loss、数据增强与预处理策略,重新审视希望语音检测中的此问题。相应地,我们发现将 focal loss 作为多语言 BERT(M-BERT)训练过程的一部分,缓解了类不平衡的影响,并将总体 F1-Macro 提升 0.11。同时,基于 M-BERT 的上下文与回译词增强尽管存在不平衡,仍使结果较基线提升 0.10。最后,我们展示基于预处理的重叠词移除虽简单,却将 F1-Macro 提升 0.28。在此过程中,我们给出详细描述这些策略各类行为的实证研究,并为那些希望在真实数据不平衡条件下充分利用 M-BERT 进行希望语音检测的研究者总结关键发现。
引用
@article{arxiv.2204.05488,
title = {Overlapping Word Removal is All You Need: Revisiting Data Imbalance in Hope Speech Detection},
author = {Hariharan RamakrishnaIyer LekshmiAmmal and Manikandan Ravikiran and Gayathri Nisha and Navyasree Balamuralidhar and Adithya Madhusoodanan and Anand Kumar Madasamy and Bharathi Raja Chakravarthi},
journal= {arXiv preprint arXiv:2204.05488},
year = {2023}
}