M3TCM:用于动机访谈中话语分类的多模态多任务上下文模型
计算与语言
2024-04-05 v1 声音
音频与语音处理
摘要
动机访谈中准确的话语分类对于自动理解来访者与治疗师互动的质量和动态至关重要,并且它可以作为调节此类互动系统的关键输入。动机访谈表现出三个重要特征。首先,存在两个不同的角色,即来访者和治疗师。其次,它们通常具有高度的情绪色彩,这可以在文本和韵律中表达。最后,上下文对于对任何给定话语进行分类至关重要。以往的工作并未将所有这些特征充分纳入针对心理健康对话的话语分类方法中。相比之下,我们提出了 M3TCM,一种用于话语分类的多模态、多任务上下文模型。我们的方法首次采用多任务学习来有效地建模治疗师和来访者行为的联合和独立组件。此外,M3TCM 整合了来自文本和语音模态以及对话上下文的信息。凭借我们的新颖方法,我们在新近引入的 AnnoMI 数据集上的话语分类任务中超越了现有技术,来访者话语分类的相对改进为 20%,治疗师话语分类的相对改进为 15%。在广泛的消融研究中,我们量化了每项贡献带来的改进。
引用
@article{arxiv.2404.03312,
title = {M3TCM: Multi-modal Multi-task Context Model for Utterance Classification in Motivational Interviews},
author = {Sayed Muddashir Hossain and Jan Alexandersson and Philipp Müller},
journal= {arXiv preprint arXiv:2404.03312},
year = {2024}
}
备注
Accepted for publication at LREC-COLING'24