中文

利用自然语言处理通过文本分类寻找职业倦怠指征:从在线数据到真实世界数据

计算与语言 2024-09-24 v1 机器学习

摘要

职业倦怠在 ICD-11 中被归类为一种综合征,源于未能有效管理的慢性工作场所压力。其特征为疲惫、愤世嫉俗和职业效能降低,且由于测量方法不一致,对其患病率的估计差异很大。自然语言处理(NLP)和机器学习的最新进展为通过文本数据分析检测职业倦怠提供了有前景的工具,研究表明其具有较高的预测准确性。本文对德语文本中的职业倦怠检测做出以下贡献:(a) 收集了一个包含自由文本回答和 Oldenburg Burnout Inventory (OLBI) 响应的匿名真实世界数据集;(b) 展示了在在线数据上训练的基于 GermanBERT 的分类器的局限性;(c) 提出了精心整理的 BurnoutExpressions 数据集的两个版本,由此产生的模型在真实世界应用中表现良好;(d) 提供了来自跨学科焦点小组关于用于职业倦怠检测的 AI 模型可解释性的定性见解。我们的发现强调,AI 研究人员与临床专家之间需要加强合作以改进职业倦怠检测模型。此外,还需要更多真实世界数据来验证和增强当前 NLP 研究中开发的 AI 方法的有效性,这些方法通常基于从在线来源自动抓取的数据,且未在真实世界语境中进行评估。这对于确保 AI 工具适用于实际应用至关重要。

关键词

引用

@article{arxiv.2409.14357,
  title  = {Using Natural Language Processing to find Indication for Burnout with Text Classification: From Online Data to Real-World Data},
  author = {Mascha Kurpicz-Briki and Ghofrane Merhbene and Alexandre Puttick and Souhir Ben Souissi and Jannic Bieri and Thomas Jörg Müller and Christoph Golz},
  journal= {arXiv preprint arXiv:2409.14357},
  year   = {2024}
}