面向心理健康数据的自我状态识别与分类基线:CLPsych 2025 任务
计算与语言
2025-04-22 v1 机器学习
摘要
我们为 CLPsych 2025 A.1 任务提出了一个基线方案,用于对来自 Reddit 的心理健康数据中的自我状态进行分类。我们采用 4 位量化的 Gemma 2 9B 模型进行少样本学习,并通过一种数据预处理步骤:首先识别指示自我状态证据的相关句子,然后进行二元分类以判断该句子是否为适应性或适应性自我状态的证据。该系统优于我们另一种依赖大型语言模型独立标记可变长度片段的方法。我们归因于句子分块步骤带来的性能优势,原因有二:1)将帖子划分为句子广泛匹配人工标注的自我状态粒度;2)将任务简化为二元分类问题。我们的系统在提交给任务 A.1 的十四个系统中名列第三,测试时召回率达到 0.579。
引用
@article{arxiv.2504.14066,
title = {A Baseline for Self-state Identification and Classification in Mental Health Data: CLPsych 2025 Task},
author = {Laerdon Kim},
journal= {arXiv preprint arXiv:2504.14066},
year = {2025}
}
备注
Accepted to CLPsych Workshop, NAACL 2025