中文

使用 LoRA 微调大型音频-语言模型以精确时间定位延长暴露治疗要素

音频与语音处理 2025-12-22 v4 计算与语言 人机交互

摘要

延长暴露(PE)治疗是创伤后应激障碍(PTSD)的有效治疗方法,但由于需要手动审查治疗记录,评估治疗师忠实度仍然劳动密集型。我们提出了一种从治疗会话音频和转录文本中自动时间定位关键 PE 忠实度要素(识别其起始和结束时间)的方法。我们的方法使用低秩适配(LoRA)微调一个大型预训练音频-语言模型 Qwen2-Audio,以处理聚焦的 30 秒音频-转录输入窗口。通过基于大语言模型的提示生成三个核心协议阶段(治疗师引导 P1、意象暴露 P2 和意象后加工 P3)的忠实度标签,并由经过培训的评估者进行验证。该模型在任务特定提示的引导下,使用软监督预测归一化边界偏移。在 308 个真实 PE 会话的数据集上,我们的最佳配置(LoRA 秩 8,30 秒窗口)在各项任务上实现了 5.3 秒的平均绝对误差(MAE),处于时间戳审查的典型评估者容差范围内,使忠实度质量控制具备实用性。我们进一步分析了窗口大小和 LoRA 秩的影响,强调了上下文粒度和模型适配的重要性。本工作引入了一个保护隐私、可扩展的 PE 治疗忠实度追踪框架,有望支持临床医生培训、监督和质量保证。

关键词

引用

@article{arxiv.2506.09707,
  title  = {Fine-Tuning Large Audio-Language Models with LoRA for Precise Temporal Localization of Prolonged Exposure Therapy Elements},
  author = {Suhas BN and Andrew M. Sherrill and Jyoti Alaparthi and Dominik Mattioli and Rosa I. Arriaga and Chris W. Wiese and Saeed Abdullah},
  journal= {arXiv preprint arXiv:2506.09707},
  year   = {2025}
}

备注

5 pages, 2 figures