中文

WhiSPA:语义与心理对齐的 Whisper 自监督对比学习与学生-教师学习

音频与语音处理 2025-06-03 v4 人工智能 计算与语言 声音

摘要

当前语音编码管道通常依赖额外的基于文本的语言模型来获取对人类交流具有鲁棒性的表示,尽管最先进的语音到文本模型通常包含一个语言模型。本工作提出了一种改进语音模型内部语言模型的方法,使后续文本语言模型不再必要。我们引入 WhiSPA(Whisper with Semantic and Psychological Alignment),其利用一种新颖的音频训练目标:以语言模型嵌入作为教师的对比损失。使用来自心理健康音频访谈的超过 50 万段语音,我们评估了将 Whisper 的潜在空间与来自文本自编码器(SBERT)的语义表示以及基于情感和人格等基本心理维度的词汇派生嵌入进行对齐的实用性。在自监督情感任务和下游心理任务上,WhiSPA 超越了当前语音编码器,分别实现了 73.4% 和 83.8% 的平均错误降低。WhiSPA 表明,对于获取人类交流的丰富心理表示,不必始终在语音到文本输出上运行后续文本语言模型。

关键词

引用

@article{arxiv.2501.16344,
  title  = {WhiSPA: Semantically and Psychologically Aligned Whisper with Self-Supervised Contrastive and Student-Teacher Learning},
  author = {Rajath Rao and Adithya Ganesan and Oscar Kjell and Jonah Luby and Akshay Raghavan and Scott Feltman and Whitney Ringwald and Ryan L. Boyd and Benjamin Luft and Camilo Ruggero and Neville Ryant and Roman Kotov and H. Andrew Schwartz},
  journal= {arXiv preprint arXiv:2501.16344},
  year   = {2025}
}

备注

16 pages, 8 figures, ACL 2025