中文

面向酒精使用减少的编码动机访谈中的多模态自洽推理

计算与语言 2026-05-19 v2

摘要

背景:编码动机访谈(MI)session对于理解客户行为和预测结果至关重要,但需要专业人员投入大量时间和劳动力。近期的音频语言模型(ALMs)为自动化 MI 编码提供了新的机会,通过捕捉多模态行为信号。目标:本研究旨在开发一种基于 ALMs 的自动 MI 编码方法,该方法分析原始音频输入,并通过自洽性整合来自多个推理轨迹的预测,以提高编码的鲁棒性。方法:我们实验了来自去标识化 MI 音频带带的五个录制 session。我们部署了四个互补分析提示符以支持 utterance 级别的推理:用于 verbal cues 的分析性提示符、用于 acoustic cues 的韵律感知提示符、用于定量假设检验的证据评分提示符,以及用于对比推理的比较提示符。每个提示符抽取三个随机样本,生成每个 utterance 的 12 个独立推理轨迹。最终预测通过所有轨迹的多数投票确定。结果:使用准确率、精确率、召回率和宏平均 F1 分数进行评估。所提出的多模态自洽方法实现了 52.56% 的准确率、54.03% 的精确率、47.45% 的召回率和 46.40% 的宏平均 F1 分数,显著优于基线方法。系统性消除实验持续降低主要指标上的性能。结论:多模态自洽方法在 MI 编码中优于单次 pass 基线提示方法。这一发现表明,结合客户所说的内容及其说话的方式,可支持更可靠的自动 MI 编码。

关键词

引用

@article{arxiv.2605.12987,
  title  = {Leveraging Multimodal Self-Consistency Reasoning in Coding Motivational Interviewing for Alcohol Use Reduction},
  author = {Guangzeng Han and James G. Murphy and Benjamin O. Ladd and Xiaolei Huang and Brian Borsari},
  journal= {arXiv preprint arXiv:2605.12987},
  year   = {2026}
}