利用过程知识学习自动化生成后续问题以用于 Reddit 帖子的抑郁症分诊
人工智能
2023-01-10 v1 计算与语言
摘要
由深度语言模型(DLMs)驱动的对话代理(CAs)在心理健康领域已展现出巨大潜力。显著地,CAs 已被用于向患者提供信息性或治疗性服务。然而,现有工作尚未探索 CAs 在辅助心理健康分诊中的效用,因为这需要受控地生成后续问题(FQs),而在临床环境中这些后续问题通常由心理健康专业人员(MHPs)发起并引导。在抑郁症背景下,我们的实验表明,与无过程知识支持的 DLMs 相比,结合心理健康问卷中过程知识的 DLMs 基于与 PHQ-9 数据集中问题的相似度和最长公共子序列匹配分别生成出优 12.54% 和 9.37% 的 FQs。尽管结合了过程知识,我们发现 DLMs 仍容易出现幻觉,即生成冗余、不相关且不安全的 FQs。我们展示了使用现有数据集训练 DLM 以生成遵循临床过程知识的 FQs 所面临的挑战。为应对该局限,我们与 MHPs 合作制备了一个基于 PHQ-9 的扩展数据集 PRIMATE。PRIMATE 包含关于 PHQ-9 数据集中特定问题是否已在用户对其心理健康状况的初始描述中得到回答的标注。我们在监督设定下使用 PRIMATE 训练了一个 DLM,以识别 PHQ-9 中哪些问题可直接从用户帖子中回答,哪些需要用户提供更多资讯。基于 MCC 分数的性能分析,我们表明 PRIMATE 适用于识别 PHQ-9 中可引导生成式 DLMs 走向受控 FQ 生成(适于辅助分诊)的问题。本研究创建的数据集:https://github.com/primate-mh/Primate2022
引用
@article{arxiv.2205.13884,
title = {Learning to Automate Follow-up Question Generation using Process Knowledge for Depression Triage on Reddit Posts},
author = {Shrey Gupta and Anmol Agarwal and Manas Gaur and Kaushik Roy and Vignesh Narayanan and Ponnurangam Kumaraguru and Amit Sheth},
journal= {arXiv preprint arXiv:2205.13884},
year = {2023}
}