使用可解释语言特征从社交媒体中早期识别焦虑的语言模式:一项作者分离评估的多方面验证研究
计算与语言
2026-01-21 v1 人工智能
机器学习
摘要
焦虑影响着全球数亿人,但大规模筛查仍然有限。社交媒体语言为可扩展的检测提供了机会,但当前模型通常缺乏可解释性、关键词鲁棒性验证和严格的用户级数据完整性。本工作提出了一种通过语言可解释的、基于特征的建模和跨域验证来进行基于社交媒体的焦虑检测的透明方法。使用一个庞大的Reddit帖子数据集,我们在精心策划的子版块上训练了一个逻辑回归分类器,用于训练、验证和测试划分。综合评估包括特征消融、关键词掩蔽实验以及比较焦虑组和对照组的变密度差异分析,以及使用临床访谈确诊焦虑障碍参与者的外部验证。该模型取得了强大的性能,即使在移除情感特征或掩蔽关键词后仍保持高准确率。使用最少帖子历史进行早期检测显著优于随机分类,并且跨域分析证明了与临床访谈数据的强一致性。结果表明,透明的语言特征可以支持可靠、可泛化且对关键词鲁棒的焦虑检测。所提出的框架为跨不同在线环境的可解释心理健康筛查提供了一个可复现的基线。
引用
@article{arxiv.2601.11758,
title = {Early Linguistic Pattern of Anxiety from Social Media Using Interpretable Linguistic Features: A Multi-Faceted Validation Study with Author-Disjoint Evaluation},
author = {Arnab Das Utsa},
journal= {arXiv preprint arXiv:2601.11758},
year = {2026}
}
备注
9 figures, more than 1o pages