面向抑郁语言检测的跨领域语义增强综合实证分析
计算与语言
2021-06-25 v1 人工智能
机器学习
摘要
我们分析了在标注数据稀缺时(例如从推文中检测抑郁语言)为学习任务创建词嵌入特征表示的过程。我们从一个从大型通用数据集预训练的丰富词嵌入开始,然后通过简单的非线性映射机制,用从更小且更特定的领域数据集学习到的嵌入对其进行增强。我们还尝试了几种其他更复杂的此类映射方法,包括若干基于自编码器和基于自定义损失函数的方法,这些方法通过逐渐学习接近语义相似词、远离语义不相似词来学习嵌入表示。我们强化后的表示更好地捕捉了抑郁领域的语义,因为它结合了从特定领域学到的语义以及来自通用语言的词覆盖。我们还展示了我们的词嵌入表示与简单的词袋模型、知名的_sentiment_和_psycholinguistic_词典以及通用预训练词嵌入的对比性能分析。当作为若干不同机器学习方法(包括深度学习模型)在抑郁推文识别任务中的特征表示时,我们表明我们的增强词嵌入表示取得了显著优于其他方法的 F1 分数,特别是在应用于高质量数据集时。此外,我们进行了若干数据消融测试,证实了增强技术的有效性。
引用
@article{arxiv.2106.12797,
title = {A comprehensive empirical analysis on cross-domain semantic enrichment for detection of depressive language},
author = {Nawshad Farruque and Randy Goebel and Osmar Zaiane},
journal= {arXiv preprint arXiv:2106.12797},
year = {2021}
}
备注
This is an extension over ECML-PKDD, 2019 paper "Augmenting Semantic Representation of Depressive Language: from Forums to Microblogs", with more embedding mapping/augmentation methods and data ablation tests. These experiments were done in the year 2019