基于文本时间表示的精神障碍分类
计算与语言
2024-10-08 v2 人工智能
社会与信息网络
摘要
精神障碍是全球性的挑战,由于专业心理健康人员短缺而加剧。当前的大语言模型(LLM)从社交媒体帖子预测精神障碍面临着序列文本数据复杂性和语言模型上下文长度有限的挑战。当前的语言模型方法将单个数据实例分割为多个数据块以弥补上下文大小限制。然后将对每个数据块分别应用预测模型,并选择最投票的输出作为最终预测。这导致丢失帖子之间的依赖关系和重要的时间变变量信息,从而导致性能不佳。我们提出了一种新框架,首先将按时间顺序排列的大量社交媒体帖子压缩为一系列数字。随后使用这种时变表示进行精神障碍分类。我们通过在三个不同精神疾病(抑郁、自伤和厌食症)上 outperform 当前 SOTA,实现 F1 分数提升了 5 个百分点。我们探讨了当前数据实例在语言模型上下文长度范围内的情况,并呈现实证结果,凸显文本数据时序属性的重要性。此外,我们利用所提出的框架进行跨域研究,探讨不同障碍之间的共性以及跨域数据使用的可能性。
引用
@article{arxiv.2406.15470,
title = {Mental Disorder Classification via Temporal Representation of Text},
author = {Raja Kumar and Kishan Maharaj and Ashita Saxena and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2406.15470},
year = {2024}
}
备注
RK and KM contributed equally to this work, 15 pages, 5 figures, 9 table