对齐大语言模型以通过症状描述与总结增强精神科访谈:初步研究
人工智能
2025-02-11 v2 计算与语言
摘要
背景:大语言模型(LLMs)的进展为精神科访谈这一尚未充分探索的领域开辟了新的可能性,LLMs 在此领域可能具有重要价值。本研究聚焦于通过分析经历过创伤和心理健康问题的脱北者咨询数据来增强精神科访谈。目的:研究探讨 LLMs 是否能够(1)识别对话中提示精神症状的部分并辨认这些症状,以及(2)基于访谈转录文本总结压力源和症状。方法:LLMs 的任务是(1)从转录文本中提取压力源,(2)识别症状及其对应片段,以及(3)利用提取的数据生成访谈摘要。转录文本由心理健康专家标注,用于训练和评估。结果:在使用 GPT-4 Turbo 的零样本推理设置中,102 个片段中有 73 个在识别症状相关片段时展现出召回中位令牌距离 d < 20。对于识别特定症状,微调优于零样本推理,准确率、精确率、召回率和 F1 分数达到 0.82。对于生成式摘要任务,使用症状和压力源信息的 LLMs 在 G-Eval 指标上得分较高:连贯性(4.66)、一致性(4.73)、流畅性(2.16)和相关性(4.67)。检索增强生成未显示出显著性能提升。结论:LLMs 通过微调或适当的提示工程,在症状描述方面表现出较高的准确率(超过 0.8),并在摘要生成中实现了高连贯性(4.6+)。本研究凸显了它们辅助心理健康从业者分析精神科访谈的潜力。
引用
@article{arxiv.2403.17428,
title = {Aligning Large Language Models for Enhancing Psychiatric Interviews Through Symptom Delineation and Summarization: Pilot Study},
author = {Jae-hee So and Joonhwan Chang and Eunji Kim and Junho Na and JiYeon Choi and Jy-yong Sohn and Byung-Hoon Kim and Sang Hui Chu},
journal= {arXiv preprint arXiv:2403.17428},
year = {2025}
}