利用对比对抗训练改进推文的身体健康提及分类
人工智能
2022-03-04 v1
摘要
身体健康提及分类(HMC)将输入文本分类为是否提及健康。疾病词汇的隐喻性及非健康提及使该分类任务具有挑战性。学习输入文本的上下文是解决此问题的关键。其思路是通过周围词学习词表示,并利用文本中的表情符号来帮助改进分类结果。在本文中,我们在模型微调期间使用充当正则化器的对抗训练来改进输入文本的词表示。我们通过扰动模型的嵌入来生成对抗样本,然后在干净样本与对抗样本对上训练模型。此外,我们利用对比损失将干净样本与扰动样本对在表示空间中彼此拉近,而将其他样本推远。我们在公开可用的 PHM2017 数据集的扩展版本上训练并评估该方法。实验表明,相对于 BERT-Large 基线提升 1.0%,相对于 RoBERTa-Large 基线提升 0.6%,而相对于最先进(SOTA)方法在 F1 分数上提升 5.8%。此外,我们借助可解释 AI 的能力对结果进行了简要分析。
引用
@article{arxiv.2203.01895,
title = {Improving Health Mentioning Classification of Tweets using Contrastive Adversarial Training},
author = {Pervaiz Iqbal Khan and Shoaib Ahmed Siddiqui and Imran Razzak and Andreas Dengel and Sheraz Ahmed},
journal= {arXiv preprint arXiv:2203.01895},
year = {2022}
}