belabBERT:应用于精神科分类的荷兰语 RoBERTa 语言模型
计算与语言
2021-06-03 v1
摘要
自然语言处理(NLP)正成为自动识别人类特质与状态(如中毒、精神疾病存在、气道疾病存在与压力状态)的重要手段。此类应用有潜力成为在线帮助热线的重要支柱,并可能逐步引入电子健康模块。然而,NLP 具有语言特异性,对于荷兰语等语言,NLP 模型稀缺。因此,近期荷兰语 NLP 模型对跨句长程语义依赖的捕捉能力较低。为克服此问题,我们在此提出 belabBERT,一种扩展 RoBERTa 架构的新型荷兰语语言模型。belabBERT 在大型荷兰语语料库(+32 GB)网络爬取文本上训练。我们将 belabBERT 应用于精神疾病的分类。首先,我们评估了基于 belabBERT 文本分类的效果,并将结果与现有 RobBERT 模型比较。随后,我们将 belabBERT 的性能与基于音频的精神疾病分类进行比较。最后,进行了简要探索,将框架扩展至混合文本与音频分类。我们的结果显示 belabBERT 优于当前荷兰语最佳文本分类网络 RobBERT。belabBERT 也优于仅基于音频的分类。
引用
@article{arxiv.2106.01091,
title = {belabBERT: a Dutch RoBERTa-based language model applied to psychiatric classification},
author = {Joppe Wouts and Janna de Boer and Alban Voppel and Sanne Brederoo and Sander van Splunter and Iris Sommer},
journal= {arXiv preprint arXiv:2106.01091},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:2008.01543